尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

成本陷阱(上):开源模型的蜜糖,Token工厂的砒霜!

成本陷阱(上):开源模型的蜜糖,Token工厂的砒霜! 文章目录一、开源的是“图纸”不是“工厂”二、钱到底花在了哪里三、四笔账云厂商的钱亏在哪损失一显存压缩的红利大打折扣损失二稀疏计算的通信开销吃掉性能红利损失三GPU资源利用率天然偏低损失四推理效率以外的隐性成本四、一笔完整的账月亏134万当前市场定价盈亏推算五、三种活法大型云厂商交叉补贴长期布局中型智算云厂商卖算力而非卖Token小型平台型厂商做分发和聚合三类厂商对比六、开源到底改变了什么结语模型开源了权重免费了论文全公开了——那为什么云厂商部署出来的成本还是原厂的三倍我拿2026年6月的真实定价算了一笔账月收入60万的MaaS服务月成本194万。用户越多亏得越多。这不是经营不善是数学上就不成立。这篇文章拆的就是这件事钱到底亏在了哪里以及为什么开源解决不了它。一、开源的是“图纸”不是“工厂”DeepSeek创始人梁文锋在一次内部交流中说过这样一段话“哪怕模型开源了所有原理都公开了别人要用起来门槛依然非常高要把成本做到同样低更是难上加难。并不是我开源了别人就能轻易做到跟我一样的部署成本。”他给出了一个财务锚点DeepSeek的API定价按十个月收回设备采购成本来设定。如果第三方拿开源模型自行部署成本可能是原厂的几倍甚至二十倍。作为智算云计费系统的设计者我对此深有感触。在云厂商内部我们看报价单的方式和客户完全不同——客户看到的是H800 2美元/小时我们看到的是这张卡在不同推理框架下的有效产出是多少token/秒单位token的固定成本和边际成本分别多少闲置率吃掉了多少毛利。这句话翻译成云计算从业者熟悉的语言就是开源发布的是图纸不是工厂。你拿到了图纸模型权重架构论文但图纸不会自动变成一座高效运转的工厂推理服务。从图纸到工厂之间隔着一整套深度的工程能力。一份代码不同团队部署出来的性能和成本可以差几倍。大模型推理把这个差距进一步放大了——因为它的优化深度远超传统软件。那差距到底卡在哪很多人第一反应是算力不够。其实不是。二、钱到底花在了哪里先说一个反直觉的结论大模型推理最大的瓶颈不是计算能力FLOPS而是显存GPU Memory。大模型在生成每一个词的时候需要记住之前所有的对话上下文这些记忆数据称为KV缓存。随着对话变长、并发用户增多KV缓存会占满GPU显存成为限制吞吐量的第一道墙。这意味着推理成本优化的核心不是算得更快而是在有限显存里塞下更多并发、更长的上下文。谁能更高效地利用每一字节显存谁的成本就更低。从计费视角看云厂商按token计费但成本端是按GPU时间计费。中间的转换公式是每百万token成本 GPU小时单价 ÷ GPU小时产出token数 × 1,000,000GPU小时产出token数即吞吐量越高单位token成本越低。而吞吐量的上限往往不是算力卡住的而是显存卡住的。这就是为什么显存利用效率直接决定了你的成本竞争力。原厂通过模型架构创新和全栈工程优化在这道墙上开了好几扇门。但云厂商拿到开源模型后这些门并非自动敞开——它们需要配套的钥匙底层工程能力才能真正打开。那云厂商到底在哪些环节丢了钥匙我把它拆成四笔账来算。三、四笔账云厂商的钱亏在哪损失一显存压缩的红利大打折扣DeepSeek在模型架构上做了一个关键创新把对话记忆压缩成极小的摘要再存储显存占用直接降低93%。这是它成本低的第一个秘密。模型权重开源了压缩机制也在权重里。但问题是要真正享受这个红利推理引擎必须能直接在压缩状态下计算——不是解压后再处理而是“带着压缩包直接干活”。这需要深度定制的底层程序。这里需要理解两个概念推理框架把模型权重变成可调用API的中间层软件类似“数据库引擎”——同样的数据不同引擎速度差几倍。主流的两个是vLLM使用最广和SGLangDeepSeek官方推荐。算子KernelGPU上的底层计算程序类似“专用指令”。原厂为特定模型手写专用算子通用框架用标准库的通用算子两者性能可以差数倍。通用框架虽然已经支持了这套压缩机制但有三个现实问题硬件适配不全只在最新GPU上效果好混合集群上大打折扣、精度支持不完整FP8支持缺失导致显存消耗翻倍、数据布局复杂底层程序需完全重写。结果就是93%的压缩红利实际能拿到的约为一半。翻译成钱同样一张H800原厂每小时产出约5500万token通用框架只有2800万-3800万约为原厂的50%-70%。仅此一项单位token成本就贵了40%-100%。损失二稀疏计算的通信开销吃掉性能红利原厂做了什么DeepSeek V3总参数671B但每个词只需要激活其中37B的参数来计算。这相当于一个6710亿参数的超级大脑每次思考只动用370亿的神经元。这是其成本低的关键所在。但问题是这37B的参数不是集中在一个地方的。模型包含256个专家Expert分布在多个GPU、多个服务器节点上。每处理一个词都需要把数据发送到对应的专家所在的GPU上算完再收回来。这个操作称为All-to-All通信模型的每一层都要执行一次。用一个比喻来理解想象一家有256个专科医生的超级医院分布在多栋楼里。每个病人来了分诊台判断需要哪8位医生会诊然后病人的病历必须被打印多份分别送到这些医生所在的楼。医生看完后诊断结果还要汇总回来。这个送病历和收诊断的过程就是All-to-All通信——而它是每一层、每一个词都要做的。原厂自己的数据显示在最好的数据中心网络条件下400G InfiniBand仅送病历这个动作就将每生成一个词的时间锁定在约15毫秒。在没有任何计算的情况下速度上限就被通信卡死了。云厂商为什么损失更大原厂为了把这个通信开销压到最低自研了一套专门的通信库DeepEP做了三件通用框架做不到的事1. 通信不占用GPU计算资源。通用框架的通信操作会占用GPU的计算单元导致一边通信一边干不了活。原厂用了一种特殊机制让通信完全不占GPU计算资源真正实现边搬数据边算。2. 数据传输直接用压缩格式。原厂在传输数据时直接用FP8格式1字节而通用框架通常用BF16格式2字节通信量直接多一倍。3. 动态平衡专家负载。模型的路由是自动学习出来的有些热门专家会被频繁调用导致持有该专家的GPU忙不过来其他GPU只能干等。原厂做了实时监控加动态迁移把热门专家复制到空闲GPU上。通用框架用静态分配面对负载不均衡无能为力。此外还有一个规模门槛。原厂的生产系统使用144路专家并行需要数百张高速互联的GPU。中小云厂商没有这个规模——GPU越少跨节点通信占比越高效率越低。实际影响与成本换算业界用效率系数η来衡量这个差距——原厂η≈0.7-0.9跑出了同等计算量密集模型70%-90%的速度通用框架朴素部署η≈0.3。这相当于671B只激活37B的模型实际吞吐只相当于一个10B密集模型——稀疏激活的收益被通信吃掉了70%。换算成月度账单如果你本期望用671B模型的37B计算成本来定价实际付出的GPU成本是预期的3倍以上。损失三GPU资源利用率天然偏低原厂做了什么原厂有一个云厂商无法复制的运营策略白天全部GPU做推理服务夜间降速后释放一部分GPU做训练和研究。这种推理-训练混部模式将GPU利用率从行业典型的50%拉到接近100%。云厂商为什么做不到云厂商的MaaS模型即服务需要7×24小时保持推理可用。为了应对流量峰值比如白天办公时间的请求高峰必须预留大量冗余GPU。夜间流量低谷时这些GPU闲置但仍在计费。从计费系统设计角度这是我们设计按量计费和资源包时最头疼的问题——客户按token付费收入端波动我们按GPU时间付费成本端固定。GPU利用率55%意味着45%的时间GPU在吃空饷这45%的成本没有对应的收入来覆盖。资源包的本质是让客户承诺消费量来对赌这个闲置风险但MaaS场景下流量波动大客户也不愿意签长期承诺。实际影响云厂商的GPU利用率通常只有50%-60%意味着单位token的固定成本是原厂的1.7-2倍。损失四推理效率以外的隐性成本除了上述技术层面的损失云厂商作为服务提供商还需承担原厂不需要的额外成本成本项说明占GPU成本比例多租户隔离不同客户数据隔离安全合规要求更高3%-5%高可用保障SLA要求99.9%需要多可用区部署和故障切换5%-8%API网关和计费系统认证、限流、计量、账单等基础设施3%-5%存储和网络模型权重存储、日志存储、跨可用区数据同步3%-5%运维和安全团队7×24值守、安全审计、漏洞修复2%-3%这些隐性成本通常占GPU租赁成本的15%-20%。说句大实话这部分成本在报价单上是看不到的但会实打实地吃进你的毛利里。大云厂商通过规模效应摊薄这些固定成本中小厂商的占比只会更高。四笔账算完了。技术层面的损失加上隐性成本叠加起来是什么概念我拿2026年6月的真实定价算了一笔完整的账。四、一笔完整的账月亏134万当前市场定价2026年6月主流平台对开源大模型系列API的定价每百万Token人民币平台类型模型定位输入价格输出价格原厂直供经济版1.00元2.00元原厂直供旗舰版3.00元6.00元大云厂商A转发原厂经济版1.00元2.00元大云厂商B自研模型对标~0.80元~2.00元中型API服务商转发原厂经济版1.00元2.00元从定价策略角度主流云厂商的定价被原厂锚定了——这是典型的价格跟随者困境。卖得比原厂贵客户直接找原厂卖得和原厂一样但自己的成本是原厂的好几倍。原厂是价格领导者它把价格定在了十个月回本的水平——这个水平对它自己是有利润的对部署方是亏本的。这就是定价权的本质不是你的成本决定你的价格而是你的效率决定你能不能在原厂的价格下活下来。盈亏推算假设一个MaaS服务商日均处理100亿输出token按原厂经济版定价收费输入收入暂不计入仅算输出月收入 100亿 ÷ 100万 × 2元 × 30天 60万元月成本云厂商使用通用框架GPU利用率55%GPU数量推算100亿为输出token叠加输入token通常为输出的4倍左右日实际处理约500亿token。通用框架单卡吞吐约3300万token/小时约为原厂的50%-70%按55%利用率折算单卡日有效产出约4.4亿token。500亿 ÷ 4.4亿 ≈ 114张再考虑流量峰值冗余和多副本高可用实际需约160张H800。成本项计算过程月金额GPU租赁需约160张H800通用框架吞吐仅原厂50%-70%约164万元存储与网络模型权重、日志、跨可用区同步约15万元运维与安全7×24值守、安全审计约10万元API基础设施网关、认证、计费约5万元合计约194万元月亏损 60万 - 194万 -134万元毛利率 (60万 - 194万) / 60万 -223%这就是行业里常说的用户越多亏损越多——每多服务一个token就多亏一份钱。除非推理效率能逼近原厂否则纯API转售在数学上不可能盈利。已有中小MaaS服务商因持续亏损而宣布停止相关API服务。这不是个案而是商业模式的系统性问题。账算到这儿结论已经很残酷了。那大家是怎么活的我观察下来大致是三种活法。五、三种活法大型云厂商交叉补贴长期布局阿里云、腾讯云、华为云等头部厂商的策略不是靠MaaS本身赚钱而是将其作为生态入口阿里云宣布未来三年投入3800亿用于云和AI基础设施MaaS是带动IaaS/PaaS销售的流量入口腾讯云将开源模型接入微信等国民级应用带动整体云推理算力需求华为云从昇腾芯片到模型到应用的国产全栈方案核心诉求是国产替代的战略卡位这些厂商可以承受MaaS业务的长期亏损因为整体云生态的收益远大于推理业务的亏损。但这本质上是用其他业务的利润补贴推理的亏损——推理本身的成本效率并未改善只是亏损被转移了。从计费系统设计角度大厂的做法是用IaaS的高毛利覆盖MaaS的负毛利整体账户层面算总账。中小厂商没有这个总账可以算。中型智算云厂商卖算力而非卖Token以九章智算云DataCanvas、无问芯穹Infinigence AI为代表的中型厂商选择了不同的路线——不碰模型推理优化只卖算力和调度能力核心产品是算力包或推理算力池按自定义单位计费如九章的度/DCUH800低至9元/度套餐价用户拿到的是裸算力或容器化算力自行部署模型主打Serverless弹性架构任务秒级启动仅对有效计算时间收费重点布局垂直场景强化学习云、行业专网等避开大规模Token推理的红海核心逻辑不承担推理效率优化的技术风险也不承担Token定价的商业风险。赚的是算力资源的批零差价和调度溢价。这是一种我不碰你的蛋糕你也别来抢我的的防守策略。风险当大云厂商通过MaaS补贴变相拉低算力市场价格时定价空间被挤压。出路在于向更高附加值的AI基础设施服务转型。小型平台型厂商做分发和聚合以硅基流动SiliconFlow、模力方舟MoArk为代表的平台型厂商定位更接近模型聚合与分发层聚合大量开源模型硅基流动覆盖主流开源模型全线模力方舟聚合2万模型兼容HuggingFace生态用户一键调用提供Serverless API开发者无需关心底层GPU绑定令牌即可上架应用部分厂商延伸至边缘推理硬件如模力方舟698元PocketClaw面向个人开发者核心逻辑不自建大规模GPU集群做模型分发层聚合上游算力赚API调用差价和开发者生态。风险API质量完全依赖上游算力供应商当上游原厂或大云厂商持续降价时中间层利润被持续挤压。三类厂商对比维度大型云厂商中型智算云小型平台核心资产万卡集群全栈能力调度系统算力池模型库分发网络推理优化深度有团队但不及原厂不碰推理优化完全依赖上游盈利模式MaaS亏损→生态交叉补贴算力批零差价API分发差价硬件销售生存窗口生态绑定长期补贴中立定位垂直场景低门槛聚合边缘部署核心风险补贴战何时结束大厂压价挤压空间上游降价挤压利润月度GPU成本/原厂倍数~2-3倍N/A不卖token~3-5倍六、开源到底改变了什么分析了这么多技术细节和商业案例我想把结论收束到一个最本质的问题上——开源到底改变了什么没改变什么开源降低了模型获取成本——不需要自己花数亿元从头训练算法理解门槛——架构和原理完全公开行业整体技术水位——拉齐了所有人的认知起点开源没有降低推理服务的工程成本——底层算子优化、通信库开发、调度系统建设规模化运营的效率——GPU利用率、资源混部能力硬件协同设计的深度——从模型架构到芯片特性的全栈优化一句话概括开源传递的是知识不是能力。知识可以被复制但将知识转化为极致工程实践的系统性能力——底层程序开发、通信优化、资源调度、全栈协同——无法通过开源传递。这正是原厂信心的来源也是云厂商在部署开源大模型时始终无法获得成本优势的根本原因。结语说到底梁文峰那句话戳破了一个行业幻觉在AI时代基础设施的竞争已经从有没有算力升级为能不能把算力用到极致。开源让模型不再是壁垒但把模型变成高效推理服务的工程能力——从底层算子到通信库从调度系统到资源混部——成了新的、更难跨越的壁垒。对云厂商来说现实很骨感仅仅部署开源模型是不够的。做不到推理全链路的深度优化就始终处于成本劣势无论模型本身是否免费。我自己的判断是MaaS纯API转售这条路对绝大多数中小厂商走不通。要么你有能力做到原厂70%以上的推理效率这需要数千万级的工程投入要么你找到API以外的收入来覆盖推理亏损。两者之间没有中间地带。那如果真下决心投入深度优化能追平原厂多少具体有哪些举措这就是下一篇要回答的问题。下一篇预告《砸钱优化能追平原厂吗》关注本系列下篇继续拆。觉得有用的话转发给你身边正在做大模型部署决策的朋友。文中数据基于2026年公开信息整理技术迭代很快具体数字请以各平台最新披露为准。欢迎同行交流拍砖。
返回列表