尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

近期AI热点006|DeepSeek V4-Flash-0731 更新:Agent 跑分大涨,API 接入有哪些变化

近期AI热点006|DeepSeek V4-Flash-0731 更新:Agent 跑分大涨,API 接入有哪些变化 近期AI热点006DeepSeek V4-Flash-0731 更新Agent 跑分大涨API 接入有哪些变化主要信息源DeepSeek API 官方更新日志、DeepSeek V4 官方发布页、模型与定价文档、Responses API 文档关键词DeepSeek V4、DeepSeek-V4-Flash-0731、AI Agent、Responses API、Codex、上下文缓存、API 迁移2026 年 7 月 31 日DeepSeek 将DeepSeek-V4-Flash正式版 API 开放公测。调用时仍然使用原来的模型名deepseek-v4-flash但该别名目前已经指向DeepSeek-V4-Flash-0731。这次更新最容易产生的误解是把它写成“DeepSeek V4 正式版全面发布”。官方更新日志给出的范围更窄只升级了DeepSeek-V4-FlashAPI。DeepSeek-V4-ProAPI 没有随本次更新改变。DeepSeek App 和网页端模型没有随本次更新改变。V4-Flash-0731 与 Flash Preview 的架构和模型规模相同变化来自重新后训练。DeepSeek-V4-Pro 正式版仍被描述为“即将发布”官方没有在日志中给出确切日期。因此更准确的说法是DeepSeek V4 系列完成了一次面向 Agent 与代码工作流的 Flash API 更新而不是整个 V4 家族同时换代。先把 V4、Flash 和 0731 的关系理顺DeepSeek V4 Preview 最初于 2026 年 4 月 24 日发布。官方当时给出的两个版本分别是项目DeepSeek-V4-FlashDeepSeek-V4-Pro总参数量284B1.6T每 Token 激活参数量13B49BAPI 模型名deepseek-v4-flashdeepseek-v4-pro上下文长度1M Token1M Token最大输出最高 384K Token最高 384K TokenResponses API支持暂不支持官方称 2026 年 8 月上旬加入7 月 31 日更新状态已升级至 V4-Flash-0731本次未更新Flash 并不是 Pro 的简单量化版本。两者总参数量与激活参数量不同面向的成本和吞吐目标也不同。V4-Flash 的 284B 总参数、13B 激活参数设计更适合高并发 API 和代码 AgentV4-Pro 则把更多模型容量留给复杂推理与高难度知识任务。V4 在结构上使用 Token-wise Compression 与 DeepSeek Sparse AttentionDSA目标是降低长上下文的计算和内存压力。官方把 1M Token 作为 V4 服务的标准上下文长度但“窗口能装下 1M”不等于每个任务都应该塞满 1M。长输入仍然会增加首 Token 延迟、缓存依赖和失败重试成本。这次不是扩模型而是重新后训练官方明确说明V4-Flash-0731 保持了 Preview 的架构和规模仅进行了重新后训练。这句话很关键。Agent 能力并不只由预训练阶段的知识量决定还依赖模型在后训练中学会怎样将一个长任务拆成可执行步骤。根据工具返回值修正计划。在多个文件和多轮工具调用之间保持任务状态。发现测试失败后继续定位根因而不是换一种措辞宣布完成。生成符合工具 Schema 的参数并处理异常、超时和空结果。同一个底座经过不同的 Agent 轨迹、工具调用数据和强化学习训练表现可能发生明显变化。这也是为什么 V4-Flash-0731 可以在不改变参数规模的情况下把主要升级点放在代码 Agent、终端操作和自动化任务上。官方 Agent 跑分提升了多少DeepSeek 公布了 V4-Flash-0731 的九项 Agent 相关结果评测官方成绩主要方向Terminal Bench 2.182.7终端环境中的多步任务NL2Repo54.2从自然语言需求生成或修改代码仓库CyberGym76.7网络安全环境任务DeepSWE54.4软件工程 AgentToolathlon Verified70.3多工具调用Agent Last Exam25.2综合 Agent 难题Automation BenchPublic25.1业务自动化DSBench-FullStack68.7全栈开发DeepSeek 内部集DSBench-Hard59.6高难度代码 AgentDeepSeek 内部集官方称这些结果“远超 V4-Pro-Preview”但更新日志没有在同一张表中列出 Pro Preview 的逐项分数因此不能从公告直接计算每项提升百分比。评测条件也需要一起阅读。公开代码 Agent 测试使用尚未发布的DeepSeek Harnessminimal 模式推理强度为 maxtop_p0.95、temperature1.0DSBench-FullStack 和 DSBench-Hard 则是内部测试集。这带来三个限制Harness 尚未发布时第三方无法完整复现官方运行方式。内部测试集缺少公开样本和独立提交结果适合观察方向不适合直接用于跨厂商排名。max effort 的成绩不能代表默认设置下的延迟、Token 消耗和单位任务成本。对开发团队来说更可靠的验证方法是准备自己的 20100 个真实任务固定代码仓库版本、Prompt、工具权限、超时和最大尝试次数同时记录一次成功率、平均 Token、测试通过率和人工返工时间。Responses API 是本次更新的工程重点V4-Flash-0731 原生支持 Responses API并针对 Codex 做了适配。使用 OpenAI Python SDK 时最小调用方式如下python-m venv.venv.venv\Scripts\Activate.ps1 python-m pip install--upgrade openai$env:DEEPSEEK_API_KEY你的 API KeyimportosfromopenaiimportOpenAI clientOpenAI(api_keyos.environ[DEEPSEEK_API_KEY],base_urlhttps://api.deepseek.com,)responseclient.responses.create(modeldeepseek-v4-flash,instructions(你是代码分析助手。先定位根因和现有测试没有获得可复核证据时不要声称任务已经完成。),input检查任务队列为什么会重复消费并给出最小修改方案。,max_output_tokens4096,)print(response.output_text)print(response.usage)模型名不需要添加-0731。继续使用deepseek-v4-flash服务端就会路由到当前最新版本。这个方式便于无缝更新但也意味着生产系统不能只记录模型别名日志中最好同时保存请求时间、返回的实际模型版本和回归测试结果否则同一份代码在不同日期可能得到不同表现。“兼容 Responses API”不等于完整实现所有能力DeepSeek 官方兼容性表列出了几项容易踩坑的差异API 当前是无状态的不支持previous_response_id和conversation。store固定为false不提供服务端响应状态存储。支持函数工具和服务端网页搜索Codex 兼容的自定义工具只支持名为apply_patch的类型。file_search、code_interpreter、computer_use、mcp等内置工具会被忽略。max_tool_calls会被忽略应用必须自己限制工具调用次数。图片和文件输入尚不支持传入后不会正常提供视觉或文件内容。超过上下文窗口不会自动截断而是返回 400 错误。部分不支持的参数会被静默忽略而不是直接报错。最后一项尤其需要注意。请求成功只能说明接口接受了参数不代表每个字段都生效。迁移现有 Responses API 客户端时应根据官方兼容表逐项检查而不是把“HTTP 200”当作兼容性测试完成。流式响应也没有data: [DONE]结束标记。客户端应根据response.completed、response.incomplete或response.failed判断结束状态并分别处理文本增量、推理内容、函数参数和最终 Usage。旧模型名已经到迁移节点V4 Preview 发布时DeepSeek 宣布旧的deepseek-chat和deepseek-reasoner将在 2026 年 7 月 24 日 15:59UTC后退役。过渡期内它们分别指向 V4-Flash 的非思考与思考模式。现在已经超过官方给出的退役时间。新项目应直接使用deepseek-v4-flash deepseek-v4-pro迁移时不要只做字符串替换还要检查思考模式、最大输出、工具调用历史和错误处理。V4 同一模型支持思考与非思考模式官方当前将思考模式列为默认模式如果旧业务依赖deepseek-chat的短响应与较低 Token 消耗应显式验证新默认行为。价格很低但缓存命中率会放大差距官方价格页当前列出的单价如下单位均为每 100 万 Token计费项V4-FlashV4-Pro输入缓存命中0.0028 美元0.003625 美元输入缓存未命中0.14 美元0.435 美元输出0.28 美元0.87 美元并发上限2500500V4-Flash 的缓存命中输入价格只有未命中的 1/50。对于代码仓库、固定系统提示词和长工具定义稳定前缀比反复压缩几百个 Token 更值得优化。假设一次 Agent 任务使用 20 万输入 Token 和 2 万输出 Token情况计算估算费用输入全部未命中缓存0.2 × $0.14 0.02 × $0.280.0336 美元输入全部命中缓存0.2 × $0.0028 0.02 × $0.280.00616 美元真实任务通常是部分命中且工具返回内容、失败重试和推理 Token 都会改变费用。生产环境应记录input_tokens_details.cached_tokens和output_tokens_details.reasoning_tokens计算“每个成功任务成本”而不只是每次请求成本。价格页还预告了峰谷定价每天北京时间 9:0012:00、14:0018:00 的所有计费项将按常规价格的 2 倍计费。但截至本次核对官方尚未公布生效日期因此不能把双倍价格写成已经实施。批处理系统可以提前预留调度开关等官方确认生效后再避开峰值时段。API 更新与新权重发布要分开看4 月 24 日的 V4 Preview 公告提供了技术报告和开放权重集合。7 月 31 日的更新日志则明确讨论DeepSeek-V4-FlashAPI 公测并称 0731 版本保持原架构和规模、仅重新后训练。官方这次没有在更新日志中宣布新的 V4-Flash-0731 权重包。因此可以确认的是线上 API 已升级不能仅凭这份公告推导 0731 后训练权重已经同步开放。需要自托管的团队应以 DeepSeek 官方 Hugging Face 仓库中的具体模型卡、提交时间和许可证为准。升级前可以做一轮小型回归如果现有服务已经调用deepseek-v4-flash代码可能不需要修改但行为已经可能发生变化。上线前建议至少检查选取真实的代码修改、终端任务和工具调用轨迹建立固定测试集。分别测试思考与非思考模式并记录 Token 和延迟。验证 JSON Schema、函数参数和多轮工具结果能否稳定回传。在应用层限制工具次数、总耗时、写入路径和外部副作用。测试超长输入、工具失败、流式中断和 400/429/5xx 的处理。记录实际版本与请求时间避免模型别名自动更新后无法定位回归。V4-Flash-0731 的看点不是参数又变大了而是 DeepSeek 试图用同一底座的后训练升级换取更强的 Agent 执行能力并通过 Responses API 进入现有代码代理工作流。接下来更值得关注的是 DeepSeek Harness 能否按承诺开放、公开测试能否复现官方成绩、V4-Pro 正式版何时发布以及 0731 后训练权重是否会同步提供。对开发者而言在这些信息落地以前最有价值的动作仍然是用自己的任务集做回归而不是只根据一张跑分表决定全量迁移。参考资料DeepSeek APIChange LogDeepSeek-V4-Flash Update2026-07-31https://api-docs.deepseek.com/updatesDeepSeek APIDeepSeek V4 Preview Release2026-04-24https://api-docs.deepseek.com/news/news260424DeepSeek APIModels Pricinghttps://api-docs.deepseek.com/quick_start/pricingDeepSeek APIYour First API Callhttps://api-docs.deepseek.com/DeepSeek APIUsing the Responses APIhttps://api-docs.deepseek.com/guides/responses_apiDeepSeek APIThinking Modehttps://api-docs.deepseek.com/guides/thinking_modeDeepSeekV4 官方开放权重集合https://huggingface.co/collections/deepseek-ai/deepseek-v4
返回列表