
模型命名里有一套大家默认的秩序Flash 负责快和便宜Pro 负责更难的任务。真要二选一多数人也会觉得应该是 Flash 给 Pro 让路。DeepSeek 这次把顺序倒了过来。2026 年 9 月 10 日DeepSeek V4.1 Flash 正式发布。官方称它在性能、成本、速度和总耗时上综合超过 V4 Pro并宣布从 9 月 14 日中午 12 点起原本发往deepseek-v4-pro的请求会改由 V4.1 Flash 处理价格也按 Flash 计算直到 V4.1 Pro 上线。一个新架构家族里体量最小的模型为什么能直接坐到 Pro 的位置答案不只在“更快”两个字里。图DeepSeek V4.1 Flash 发布帖及四项 Agent 基准来源deepseek_ai。“接管 Pro”先从 API 路由说起V4.1 Flash 在 DeepSeek API 中的调用名是deepseek-flash。原有的deepseek-v4-flash和deepseek-v4-flash-vision-exp名称暂时还能使用但后端已经路由到新模型。到了 9 月 14 日deepseek-v4-pro也会作同样调整。这项安排比一句“性能超过 Pro”更直接。开发者即使没有改模型名实际收到请求的模型也可能已经发生变化。Pro 产品线并没有永久取消官方说明这段路由会持续到 V4.1 Pro 发布其他 API 服务是否同步完成切换也要以各自页面和调用结果为准。图V4.1 Flash 调用名、旧模型兼容路由与 V4 Pro 切换安排来源deepseek_ai。552B 参数输入和输出却用两套“力气”V4.1 Flash 是一个 552B 参数的 MoE 模型但每个 token 并不会调动全部参数。DeepSeek 采用了非对称的 Causal Encoder-Decoder 架构处理输入时激活 8B 参数生成输出时激活 16B 参数。这套分配很适合长提示词和 Agent 任务。模型读取代码仓库、文档或历史对话时先用更轻的计算处理大量输入真正开始推理和生成时再投入更多参数。它没有把整个过程都压到同一档计算量上也没有为了速度把生成阶段一并削薄。官方还把新的预训练方法和更大规模强化学习列为能力提升来源。图552B MoE、输入 8B/输出 16B 激活参数与官方完整基准表来源deepseek_ai。Flash 能不能接住 Pro要看它会不会把任务做完这次官方重点展示的也不只是知识问答。V4.1 Flash 在 Terminal-Bench 3.0 上得到 30.0DeepSWE v1.1 为 74.2CyberGym 为 88.1Automation-Bench 为 54.8。四项结果分别指向终端操作、代码仓库任务、安全场景和自动化流程更接近 Agent 连续调用工具、修改内容并完成目标的工作方式。DeepSeek 据此给出了“综合超过 V4 Pro”的判断。不过完整表格里并非每一项分数都高于 V4 Pro也不是所有外部模型都被 V4.1 Flash 压过。更有意思的是它用 Flash 的计算和价格定位拿到了足以承担复杂任务的一组结果。这也解释了为什么官方敢让它暂时接管 Pro 的 API 流量。长任务跑得多KV cache 的账迟早要算代码 Agent 和多轮工具任务会反复携带上下文。输入越长、轮次越多KV cache 占用的显存和存储越难忽略。DeepSeek 公布的数据是V4.1 Flash 的 KV cache 相比上一代只需要四分之一 HBM 和八分之一 SSD按每 token 计算体积从 V4 Flash 的 3514 bytes 降到了 890 bytes。图V4.1 Flash 的 KV cache 资源占用对比来源deepseek_ai。更小的缓存占用会直接影响服务端能承载多少长上下文任务。用户最终看到的 API 价格则是另一套口径官方峰时每百万 token 的缓存命中价为 0.006 美元缓存未命中输入为 0.3 美元输出为 1.2 美元低谷时段价格减半。资源效率和调用价格放在一起看Flash 接管 Pro 才不只是一次性能排名变化。“Flash”这次也不只接轻任务V4.1 Flash 原生支持视觉理解官方接口还提供 1M 上下文、384K 最大输出、工具调用、Responses API 和 Anthropic API。它可以读更长的任务材料也能把图片放进 Agent 的输入范围。这些规格不代表所有长任务和视觉任务都会自动做好却补齐了它接手复杂工作所需的接口范围。以前看到 Flash开发者可能只想到聊天、摘要和轻量代码补全V4.1 Flash 的目标明显更大它开始覆盖代码仓库、终端操作、多轮工具调用和视觉输入。名字还在背后的模型可能已经变了V4.1 Flash 这次能让 Pro 暂时让路靠的是几项变化同时发生输入和输出阶段分别控制激活参数Agent 与代码任务达到新的官方结果KV cache 又把长上下文的资源占用压了下来。能力、速度和成本没有继续沿着 Flash/Pro 的旧分工各站一边。对开发者而言眼下最该做的不是争论它究竟算 Flash 还是 Pro。仍在使用旧模型名先确认请求实际落到了哪个版本准备接入再查看同一模型下不同 API 服务的模型信息、价格和状态确认新版本是否已经完成适配。图DeepSeek V4.1 Flash 模型详情与 API 服务页面来源OkenAI接入前具体要检查什么可以继续阅读《新模型发布后API 服务真的适配好了吗接入前检查这 4 项》。模型名完成切换只说明入口已经改变一致性、token 消耗、上下文与工具调用能不能正常工作还要逐项核对。