尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

参数规模砍到十分之一,还偏偏性能更强:DeepSeek 到底反着来什么?

参数规模砍到十分之一,还偏偏性能更强:DeepSeek 到底反着来什么? 昨晚刷 DeepSeek 开放平台的时候发现 API 文档里的模型版本悄悄换了新deepseek-v4-pro-0813。没有发布会、没有预告各家媒体都还在用V4 预览版做评测正式版就这大半夜自己上了线。版本号后缀直接标到 8 月 13 日——前脚 8 月 12 日预览版才刚把 Flash 跑分推到风口浪尖按惯例怎么说都该等 Model 卡发齐了再正式宣发后脚它就换了正式版而且调用名不变开发者一行代码都不用改。这事看着不声不响其实比开发布会还值得琢磨。先把确定的事实摆清楚。V4-ProMoE 架构总参 1.6 万亿每次推理只激活约 490 亿参数上下文给到 100 万 token输出上限 38.4 万 token原生支持思考模式开关、工具调用、结构化输出向西边兼容了 Responses API 和 Anthropic API 两家格式。定价更狠——输入 3 元/百万、输出 6 元/百万 token缓存命中输入一口价降到 0.025 元之前限时 2.5 折直接转成永久价格。另外上了峰谷计费工作日 9:00-12:00、14:00-18:00 价格翻倍引导开发者把非实时任务挪到低价时段。这价格意味着什么同样规模的稠密模型训练成本是它十几倍跑一次推理烧的钱一个天一个地。它的 MoE 本质是花小钱请了个大专家只在回答问题那一刻按需请一组专家上台——这是它敢把价格打下来的底气也是这次架构创新的真正心法。不过我更想聊的不是参数是 V4 连着的两件反着来的事。第一件是小模型反超大模型。V4-Flash总参 2840 亿、激活才 130 亿却在多项基准上跑赢自家 Pro 预览版。你放在一年前很难想象这事过去大家默认参数是硬实力同一代里 Pro 一定干翻 Flash、大的一定干翻小的这回 DeepSeek 拿 Flash 打了自己 Pro 预览版的脸。它其实在讲另一件事——架构设计和训练效率比参数规模更能决定模型的上限。V4 用的 MoE MLA多头潜在注意力 GRPO 这套底座不变正式版没动底层、纯靠把后训练做扎实、拿高质量数据重训Agent 能力相对预览版翻了快 5 倍。这说明微调的下限还远远没到天花板同一个底子能榨出来的东西差着数量级。第二件是软件定义硬件。4 月 24 日 V4 全系开源MIT那天最值得聊的不是权重而是它跑在华为昇腾 950PR 上——DeepSeek 团队把 200 多个核心算子重写了一轮模型底层从 CUDA 迁到华为 CANN 框架。说白了把英伟达家那条护城河从底层拆了重建在国产芯片上。这不是换个驱动是算子级重写、通信库重排、整个推理链路在昇腾上完整验证过。紧跟着摩尔线程也宣布在自研 MUSA 软件栈 SGLang 上完成 V4 全链路适配国产 GPU 上跑通了世界顶尖 MoE 模型。再到联通北京在京元Token 平台把 V4-Flash 正式版推上线用的是国产算力服务器还引入新一代推测解码框架。一眼望过去华为、摩尔线程、运营商怎么全在动了因为 V4 把国产芯片跑不动前沿模型这层窗户纸捅破了昇腾和 MUSA 的算子生态不再是能不能跑的问题而是多久能上的问题。所以这文章我真不想复述跑分。我想说句实在话这事是不是营销话术关键看一个机构愿不愿意把手里的东西借别人玩。参数开源看的是诚意——权重、论文、训练细节都放进去了。但开源 ≠ 大家都能玩1.6 万亿参数的 MoE就算 4bit 量化也把显存吃到爆消费级显卡跑 Flash 是能跑可缓存管理、推理框架 SGLang/vLLM 这些跟上没跟上才是体验重点。Agent 类模型真正的门槛从来不是权重是跟工具、跟编排框架怎么接。V4 的 MoE 在推理侧本来就有稀疏优势MLA 又在 KV cache 上省一道这两招才是它缓存命中价敢打到 0.025 的核心底气——依赖它算力砍到十分之一的说法没错但你要看清它砍的是哪一部分它把每次请求都重复的长上下文推理砍成了缓存命中只要一毛钱誊一遍。真要较真峰值别只盯着 490B 激活参数这数字跑一遍长上下文输出、再叠上高峰成本涨得比你想象快。往大了说我觉得 V4 这套架构少花预算、系统盘活存量的玩法是把 C 端体验那套峰谷计价搬到了 M 端最后都是要把闲置的sea 算力盘活成低价资源。沿着这套牌应该会打向再顺一程。短期最确定的甜点区Agent 工作流冲。模型总参再大激活只有殷实巨头养得住但通用 Agent 模型这种专用小模型边抄边是它没那么至也调动本地工具、把私有代码上下文案放在本地跑V4-Flash 这类省钱版本必然是 Agent 落地第一选择。中期看一旦国产芯片切了一半deepseek 这层模型层搬到 CANN/MUSA的活示范下来国产算力那硬件平台、框架、模型的闭环就真合上了——你不必为美国强、最所以合。那这轮国产大模型竞速里你的主张站哪边——架构创新派还是大力出奇迹派DeepSeek 把价格打到第三次小数点后你愿意把生产环境的活儿交给它吗评论区打一架。
返回列表