
9 月 10 日DeepSeek 正式发布了 V4.1 Flash 模型同时下调 API 价格并再次明确了峰谷定价的规则——闲时价格是高峰时段的一半。消息出来后做 API 集成的开发者群里讨论最多的不是榜单分数而是两个很朴素的问题我的账单会不会变那些定时任务是不是该挪到后半夜跑这篇文章不谈情怀就把这次更新里对写代码的人真正有影响的部分拆开讲清楚。这次到底改了什么先看模型本身。据官方发布说明V4.1 Flash 是一个552B 参数的 MoE 模型但用的是一套新的Causal-Encoder-Decoder 结构特点是输入和输出不对称输入侧只激活8B参数输出侧激活16B参数官方的说法是这种非对称设计让成本显著低于已知的同尺寸模型同时原生支持多模态视觉理解能力。翻译成大白话模型块头很大但每次干活真正调动的参数很少属于典型的用更少的算力换更强的能力。第二个值得注意的点是缓存。据官方介绍新一代模型大幅压缩了 KV Cache对 HBM 的需求降到上一代的1/4对 SSD 的需求降到1/8相比初代模型KV Cache 已经缩小了437 倍。这件事看起来偏底层但对 Agent 类应用影响很直接——上下文缓存命中往往占了相当一部分成本缓存小了长对话、多轮工具调用的账就下来了。对开发者最实际的三条变化1. 调哪个模型名直接变了V4.1 Flash 已上线 API只要把模型名改成deepseek-flash就能调用。用 OpenAI 兼容的 SDK 调大致是这样fromopenaiimportOpenAI clientOpenAI(api_keysk-xxxxxx,# 换成你自己的 Keybase_urlhttps://api.deepseek.com,)respclient.chat.completions.create(modeldeepseek-flash,# 即 V4.1 Flashmessages[{role:user,content:用一句话解释 MoE 架构}],)print(resp.choices[0].message.content)**2.旧模型名有兼容期但会到期**据官方说明V4 Flash 与 V4 Flash Vision Exp 已经下线出于兼容考虑旧模型名 deepseek-v4-flash、deepseek-v4-flash-vision-exp 会被**暂时**路由到 V4.1Flash。更关键的是 V4 Pro官方称 V4.1Flash 在性能、费用、速度等指标上全面超越 V4 Pro因此计划有序下线 V4 Pro——**北京时间9月14日12:00之后**访问 deepseek-v4-pro 的请求会全部路由到 V4.1Flash并按 V4.1Flash 的单价计费。 也就是说如果你现在的代码里写死了 deepseek-v4-pro短期不会报错但它已经在换模型了。建议尽早显式改成自己的目标模型名别依赖隐式路由。**3.分时计价任务排期要重新算**这次调价在9月10日12:00生效继续采用峰谷定价**闲时价格是高峰时段的一半**。据报道调价后空闲时段输入缓存命中的单价降至0.02元/百万 token 起整体降幅最高达到60%——这一数字来自媒体报道具体以官方价目为准。 对一般开发者来说这意味着一个很朴素的优化点**能离线跑的任务尽量挪到闲时**。比如日志摘要、批量数据清洗、文档向量化、定时爬取后的内容归纳这些跟用户实时交互无关把调度时间放到低谷时段成本可以直接砍一半。## 有几个坑要提醒-**别只看单价看缓存命中率。**峰谷价差大但真正决定账单的是缓存命中比例。同一段长上下文反复用和每次重新拼 prompt成本可能差出好几倍把稳定不变的前缀系统提示、知识片段放在前面命中率会好很多。--**开源不等于能自己部署。**官方表示会支持社区做推理适配但如果要大规模部署官方给出的门槛是具备 2k 卡 GPU 和存储集群——这不是个人开发者能碰的规模。对绝大多数人来说走 API 才是现实选择。--**兼容期不是永久期。**前面说的旧模型名路由属于过渡方案官方没有承诺长期保留业务代码还是尽早显式指定模型名更稳。## 小结这次更新技术上看是非对称结构 缓存压缩带来的成本下降工程上看是分时计价 旧模型下线带来的排期和迁移问题。模型能力在涨但落到每个开发者身上最需要动手的往往还是那几行模型名和定时任务的 cron 表达式。 你现在的项目里有写死 deepseek-v4-pro 的地方吗打算什么时候迁评论区聊聊。