尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

DeepSeek V4 Pro 正式版全平台上线:Agent 与 Coding 能力接近顶级模型,8 月 17 日起调价

DeepSeek V4 Pro 正式版全平台上线:Agent 与 Coding 能力接近顶级模型,8 月 17 日起调价 更新日期 2026.8.13内容来源 https://vibecoding.dreamfree.spaceV4 Pro 正式版已同步上线 APP、网页和 API网页和 APP 可在「专家模式」中使用。API 模型名仍为deepseek-v4-pro支持 Responses API、Tool Calls、Anthropic API并适配 Codex。思考模式支持 low / high / max 三档。官方评测显示V4 Pro 相比预览版提升明显在 Agent / Coding 多数项目上高于 Claude Opus 4.8整体接近 Claude Fable 5。DeepSWE 得分 63%当前 API 价格为缓存命中输入 0.025 元、未命中输入 3 元、输出 6 元 / 百万 tokens。8 月 17 日 0 时起改为峰谷定价高峰时段 Pro 未命中输入 9 元、输出 27 元。8 月 13 日DeepSeek 在官网确认 V4 Pro 正式版上线。APP、网页端和 API 同步更新网页和 APP 可在「专家模式」中调用API 模型名仍为deepseek-v4-pro。发布公告和定价页同时带来了两个变化正式版的 Agent / Coding 评测成绩公开了API 峰谷定价也定了下来。当前 3 元的未命中输入价格只保留到 8 月 16 日。图片来源DeepSeek官网13 日下午官网首页这则公告曾短暂撤下晚上又重新出现。结合官网新闻页APP、网页端和 API 全面上线已经是官方确认的信息。一、正式版更新了什么官方给出的改动主要集中在 Agent 能力和接口支持V4 Pro 支持 Responses API并针对 Codex 接入做了适配。API 文档还列出了 Tool Calls、JSON Output、Anthropic API 和对话前缀续写等能力FIM 补全目前仅支持非思考模式。基础规格为 1M 上下文、384K 最大输出并发限制为 500。Flash 的并发限制是 2500Pro 更适合复杂任务Flash 则适合高并发、低单价请求。思考模式现在可以按任务复杂度选档简单任务用 low日常 Agent 用 high高度复杂的任务用 max。官方默认开启思考模式effort 默认为 highV4 Pro 和 V4 Flash 都支持这三档。13 日早些时候社区反馈 max 思考深度出现异常随后又反馈问题已经修复。官方没有发布故障说明需要使用 max 的任务仍建议先用小流量确认当前行为。社区用户还反馈正式版的思维链比过去更精简常常省略不影响语义的连接词和解释。这只是用户实测印象不能据此判断模型的写作能力。二、官方评测表正式版比预览版提升了多少DeepSeek 发布的对比表覆盖 HLE、Terminal Bench 2.1、NL2Repo、Cybergym、DeepSWE、Toolathlon、Agents’ Last Exam、AutomationBench 和两项 DSBench。Flash-0731 一列与官方模型卡逐项相符表内数据可以作为比较依据。官方还注明公开基准中的 Code Agent 任务使用 DeepSeek Harness 极简模式、max 档、topp0.95、temperature1.0 测试换用其他框架后结果可能略有不同。图片来源DeepSeek官网下表保留 V4 Pro 与几个主要对手的关键分数完整对比见配图BenchmarkV4-Pro-0813V4-Pro-PreviewGLM-5.2Kimi-K3Opus-4.8Fable 5HLE无工具 / 有工具42.7 / 60.037.7 / 48.240.5 / 54.743.5 / 56.049.8 / 57.953.3 / 63.0Terminal Bench 2.187.972.181.088.385.088.0NL2Repo61.538.548.9-69.7-Cybergym83.352.7-80.078.383.1DeepSWE62.712.846.267.558.070.0Toolathlon-Verified74.155.959.976.576.277.9AutomationBench Public31.812.812.930.827.229.1DSBench-FullStack71.141.861.873.771.677.2DSBench-Hard67.231.154.563.071.768.3正式版与预览版的差距正式版相较预览版提升明显DeepSWE 从 12.8 提升到 62.7Terminal Bench 2.1 从 72.1 提升到 87.9DSBench-Hard 从 31.1 提升到 67.2。Flash-0731 的 DeepSWE 是 54.4Pro 正式版又高出 8.3 个百分点。V4 Pro 这次升级的重点落在后训练和 Agent 工作流长周期代码任务、终端操作、工具调用和企业自动化的分数都明显提高。V4 Pro 与 Fable 5 仍有差距V4 Pro 在 Terminal Bench 2.1 上是 87.9Fable 5 是 88.0几乎持平Cybergym 上 V4 Pro 为 83.3反而高于 Fable 5 的 83.1AutomationBench Public 也以 31.8 高于 Fable 5 的 29.1。但在 DeepSWE、Toolathlon 和 DSBench-FullStack 上V4 Pro 分别为 62.7、74.1 和 71.1Fable 5 则是 70.0、77.9 和 77.2。V4 Pro 已经接近 Fable 5在少数 Agent 评测上反超但整体仍有差距。V4 Pro 在 Agent / Coding 评测中多数领先 Opus 4.8V4 Pro 在 Terminal Bench、Cybergym、DeepSWE 和 AutomationBench 上高于 Opus 4.8DSBench-FullStack 71.1 与 Opus 4.8 的 71.6 基本持平。HLE 的有工具成绩则是 V4 Pro 60.0 高于 Opus 4.8 的 57.9。HLE 无工具、NL2Repo、Toolathlon 和 DSBench-Hard 上Opus 4.8 仍然更高Agents’ Last Exam 两者同为 25.7。综合这些项目V4 Pro 在 Agent / Coding 评测上多数领先 Opus 4.8但在知识推理和部分工程任务上仍有差距。V4 Pro 与 Kimi K3 接近领先 GLM-5.2Kimi K3 在 DeepSWE、Toolathlon、Agents’ Last Exam 和 DSBench-FullStack 上高于 V4 Pro但 V4 Pro 在 Cybergym、AutomationBench 和 DSBench-Hard 上领先Terminal Bench 也只差 0.4 分。两者分数接近Kimi K3 整体略高。与 Kimi K3 的差距不同V4 Pro 在除 Cybergym 外的各项对比中都高于 GLM-5.2。Artificial Analysis 的 Intelligence Index 中两者同为 53综合智能分数与 Agent 评测并不完全一致。三、DeepSWE更接近实际 Coding Agent 任务DeepSWE 更接近 Cursor、Codex 这类工具的实际用法给模型一个目标让它在真实仓库里翻代码、改文件、跑验证遇到问题再继续修改多步完成一项工作。DeepSWE 由 Datacurve 维护测试长周期软件工程任务。当前 v1.1 有 113 个任务、91 个仓库和 5 种语言所有模型统一使用 mini-swe-agent。任务全部从零开始不从现成 commit / PR 改编验证器由人工编写检查任务行为是否正确不要求实现方式与参考答案一致。相比短题榜或固定仓库修补任务DeepSWE 的 prompt 约为 SWE-bench Pro 的一半长但解决方案代码量是后者的 5.5 倍输出 token 约 2 倍更接近 Agent 在项目中连续写代码的场景。图片来源DeepSWE在榜单的 max 配置下V4 Pro 的 Pass1 为63%±6%排在第 9 位高于 Opus 4.8 的 59%±2%低于 Fable 5 的 70%±4%、Kimi K3 的 69%±5% 和 Grok 4.6 的 67%±2%。官方对比表中的 DeepSWE 分数为 62.7与榜单的 63%接近。V4 Pro 已经超过 Opus 4.8但还没有追上 Fable 5 和 Kimi K3。模型DeepSWE Pass1DeepSWE 平均成本 / 任务Claude Fable 570%±4%$21.63Kimi K369%±5%$4.65Claude Opus 4.859%±2%$13.22DeepSeek V4 Pro 081363%±6%$0.06DeepSeek V4 Flash 073153%±4%$0.10GLM-5.244%±2%$3.92图片来源DeepSWE图的纵轴是 DeepSWE 分数越高越好横轴是每任务平均成本而且刻度是反的左边更贵右边更便宜最右侧接近 0。右上角标注了 most efficient越靠上、越靠右越好。Claude Opus 5、Fable 5 的分数更高但都落在左侧高价区Kimi K3、Grok 4.6 位于中间。DeepSeek 的两个点明显贴近右侧V4 Pro 每任务平均成本 $0.06全榜最低Flash 是 $0.10。V4 Pro 的分数不是榜首63%也低于 Fable 5 的 70%但它用接近 60%的完成率换来了远低于其他高分模型的任务成本。这里的成本采用榜单评测口径不能直接当成 8 月 17 日涨价后的 API 账单。四、Artificial Analysis综合智能与 Agent 能力分开看Intelligence Index 看综合能力Agentic Index 看 Agent 任务两个分数对应不同维度。V4 Pro 0813 在 Intelligence Index 中与 GLM-5.2 并列在 Agentic Index 中略高于 Opus 4.8、V4 Flash-0731 和 GLM-5.2。模型Intelligence IndexAgentic IndexClaude Fable 56257Kimi K36054Claude Opus 4.85749DeepSeek V4 Pro 08135350DeepSeek V4 Flash 07315248GLM-5.25346两项分数放在一起看V4 Pro 的优势主要落在 Agent 任务而不是综合能力榜首。图片来源Artificial Analysis Intelligence Index在 Artificial Analysis Intelligence Index v4.1.1 中V4 Pro 0813 得分 53与 GLM-5.2 并列低于 Fable 5 的 62、Opus 5 的 63 和 Kimi K3 的 60高于 V4 Pro 预览版的 44。和预览版相比正式版的综合能力提升明显。图片来源Artificial Analysis Agentic IndexAgentic Index 中V4 Pro 0813 得分 50高于 Opus 4.8 的 49、V4 Flash-0731 的 48 和 GLM-5.2 的 46低于 Fable 5 的 57 和 Kimi K3 的 54。这个分数更能对应 V4 Pro 的使用场景Agent、工具调用和长周期 Coding 任务。五、价格8 月 17 日起进入峰谷定价当前官方 API 定价如下单位是每百万 tokens有效期到北京时间 8 月 17 日 0 时之前项目deepseek-v4-prodeepseek-v4-flash缓存命中输入0.025 元0.02 元缓存未命中输入3 元1 元输出6 元2 元上下文长度1M1M最大输出384K384K并发限制50025008 月 17 日 0 时起DeepSeek 对 V4 全系列实行峰谷定价。高峰时段是北京时间 9:00–12:00、14:00–18:00其余为空闲时段闲时价格是高峰的一半。模型时段缓存命中输入缓存未命中输入输出deepseek-v4-pro闲时0.15 元4.5 元13.5 元deepseek-v4-pro高峰0.30 元9.0 元27.0 元deepseek-v4-flash闲时0.05 元1.5 元4.5 元deepseek-v4-flash高峰0.10 元3.0 元9.0 元闲时价格并不会回到当前水平。Pro 未命中输入将从 3 元涨到闲时 4.5 元、高峰 9 元输出从 6 元涨到闲时 13.5 元、高峰 27 元。Flash 也会一起上调未命中输入从 1 元涨到闲时 1.5 元、高峰 3 元输出从 2 元涨到闲时 4.5 元、高峰 9 元。对 Agent 请求输入通常占大头如果 95% 的输入命中缓存按1% 输出、99% 输入、输入侧 95% 缓存命中折算每百万 tokens 的综合价如下模型当前8 月 17 日起闲时8 月 17 日起高峰deepseek-v4-pro0.23 元0.50 元1.00 元deepseek-v4-flash0.09 元0.17 元0.33 元按这个用量结构Pro 综合价约为当前的 2.2 倍闲时和 4.3 倍高峰Flash 约为 1.9 倍和 3.8 倍。综合价上涨的主要原因是缓存命中价格从 0.025 元提高到 0.15 / 0.30 元在这个假设中约 94% 的 token 都走缓存命中输出只占 1%。V4 Pro 当前的标价仍是 Flash 的 3 倍并发只有 Flash 的五分之一。高频、低复杂度请求继续交给 Flash 更合适需要复杂规划、长链路执行和高质量代码修改的任务再考虑使用 Pro。涨价后能错峰的 Agent 任务尽量放在闲时。六、要不要用日常 vibe coding、在 Codex 或 Responses API 中运行长链路 AgentV4 Pro 值得优先测试。DeepSWE 已经高于 Opus 4.8整体接近 Fable 5按当前假设计算每百万 tokens 综合价约 0.23 元8 月 16 日前完成迁移和压测成本最低。并发不超过 500、任务以修改代码仓库为主时Pro 更合适。如果请求量大、需要接近 2500 并发或者任务本身不需要 Pro 的完成率Flash 更合适。它的 DeepSWE 分数低一截但综合价约 0.09 元涨价后闲时约 0.17 元仍然便宜不少。如果最看重单项上限和知识推理的稳定性Fable 5、Opus 4.8 仍然更稳。V4 Pro 在 Agent / Coding 上接近它们但没有每项都追上。8 月 17 日之后可以排队的任务放到闲时Pro 综合价约 0.50 元是高峰 1.00 元的一半。高峰必须使用 Pro 时可以先用 high 档思考避免所有任务都以 max 档运行。七、总结DeepSeek V4 Pro 正式版已经进入 Coding Agent 第一梯队APP、网页端和 API 也已同步上线。公开数据中V4 Pro 尚未全面超过 Fable 5与 Opus 4.8 的比较也有胜有负但它在 Terminal Bench、Cybergym、DeepSWE、AutomationBench 等 Agent / Coding 任务上占据优势DeepSWE 单项和榜单都高于 Opus 4.8。价格仍是 V4 Pro 的重要优势按高缓存命中计算当前每百万 tokens 综合价约 0.23 元。8 月 17 日 0 时起同样口径下高峰综合价约 1.00 元。需要 Coding Agent 能力、又要控制成本的可以在调价前完成测试追求高并发和低成本的Flash 仍然更合适只是它也会同步涨价。数据来源 https://vibecoding.dreamfree.space相关体验 DeepSeek 路线对比与使用入口原文链接 DeepSeek-V4-Pro 正式版上线
返回列表