Kimi K3 定价解构:表观便宜背后,思考 token 与 1M 上下文改写了真实账单

发布时间:2026/7/23 13:14:49

Kimi K3 定价解构:表观便宜背后,思考 token 与 1M 上下文改写了真实账单 Kimi K3 在 7 月 17 日发布后被反复贴上最便宜的前沿模型标签。本文不重复这一标签而是把它的 API 计费层拆开看清表观价与真实成本之间的缝隙。一、API 计费层架构四个独立变量K3 的 API 计费由四层叠加每层都直接影响账单输入层缓存命中 2 元 / 未命中 20 元每百万 tokens输出层100 元 / 百万 tokens统一价不分上下文档思考层与输出层共用 100 元 / 百万 tokens上下文层1M token 上限按实际入参 token × 单价计费不分档四层共同决定了真实账单。把任意一层忽略都会得到一个不准确的数字。二、思考 token 是最大的隐藏成本官方文档明确K3 始终推理reasoning_effort 当前仅 max。也就是说任何一次调用都包含一段思考 token且按输出价计费。不同任务类型的思考占比经验值任务类型思考 token / 输出 token简单问答0.5–1.5x文档分析1.5–3x多步 Agent 任务3–8x复杂代码生成5–10x关键观察越复杂的任务K3 越便宜的表观优势被思考成本吃掉得越多。一个 3–8x 思考占比的 Agent 任务输出侧真实成本可能是表观输出价的 4–9 倍。三、1M 上下文不分档规模越大账单越线性放大与某些模型在超过 32K 或 128K 后单价翻倍不同K3 选择 1M 统一价。这意味着8K 任务 vs 1M 任务输入侧成本差 125 倍没有用 32K 的人补贴用 1M 的人的内部交叉补贴设计 Agent 时需要更精细的上下文裁剪而不是直接塞满四、缓存命中率宣传 90% 只覆盖编程场景官方原话“借助 Mooncake 分离式推理架构Kimi 官方 API 编程场景的缓存率超过 90%。” 注意限定词是编程场景。不同场景的经验命中率编程多轮迭代同一文件80–95%客服问答多轮固定话术库40–60%文档分析每次不同文档10–30%营销文案每次不同 prompt5–15%把90% 命中率直接套到所有场景是这次宣传中最容易被忽略的细节。五、可复用算账模板设单次任务输入 N tokens思考 T tokens实际输出 O tokens缓存命中率 H。单次成本 N × (1−H) × 20 N × H × 2 (T O) × 100以60K 长文档分析、思考 90K、输出 10K、缓存命中率 30%为例输入60K × 0.7 × 20 60K × 0.3 × 2 840 36 876 元 / 百万 0.876 元输出含思考(90K 10K) × 100 10 元单次账单 ≈ 10.88 元如果错把表观输入 2 元当平均价账单会被低估一个数量级。六、算力供给侧的硬约束7 月 19 日月之暗面公告发布 48 小时后用户请求逼近集群承载极限暂停 C 端新会员订阅。4 档年费会员468/948/1908/6708 元全部售罄。API 暂时仍可调用但 C 端体验入口已关。对企业用户的影响是高峰期可能出现排队、限流、临时不可用。算账前先确认能稳定买到。七、官方对能力定位的措辞月之暗面公开声明“虽然 Kimi K3 的整体表现仍落后于最强的闭源模型 Claude Fable 5 和 GPT-5.6 Sol但在我们的整套评测中展现出前沿水平的能力并稳定超过了其他所有模型。”这条措辞定义了 K3 的真实位置开源与价格阵营的旗舰而非能力榜榜首。八、建议上线前用算账模板估算真实账单至少跑 3 个典型场景涉及多轮迭代的 Agent 任务优先确认缓存命中率思考密集型任务复杂推理、代码生成、长链规划单独评估成本7 月 27 日开源权重发布后再决定私有化部署是否值得短期采购建议API 限流配额双轨避免单一供应商绑定

相关新闻