尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

GPT-6 Astra 发布:OpenAI 说“欢迎进入 AGI 时代“,开发者先看清这五件事

GPT-6 Astra 发布:OpenAI 说“欢迎进入 AGI 时代“,开发者先看清这五件事 发布日期2026-09-04 | 信息口径OpenAI 开发者文档、系统卡、ARC Prize、Artificial Analysis 及国内媒体报道截至 2026-09-04GPT-6 Astra 是 OpenAI 于美东时间 2026 年 9 月 3 日发布的新一代旗舰模型官方定位是面向最难的端到端工作在得州 Stargate 基地用超过 10 万块 GPU 训练完成总裁 Greg Brockman 在发布会上说出了欢迎进入 AGI 时代。它在 ARC-AGI-3 上拿到 99.9%、FrontierMath Tier 4 拿到 97.6%OSWorld 2.0 计算机操作 72.6%是 OpenAI 第一个在网络安全维度触及关键级阈值的公开模型。API 模型 ID 为 gpt-6-astra上下文 105 万 Token每百万 Token 输入 10 美元、输出 50 美元是 GPT-5.6 Sol 的 2.5 倍但编程智能体场景下 Token 用量只有前代的三分之一。本文按发布内容、基准分化、计算机操作、价格逻辑、安全争议五条线梳理并给出一段可运行的接入与成本估算脚本。先说发生了什么从给答案切到干完活这次发布最值得记住的不是某个分数而是 OpenAI 对模型的定位变了。官方博客把 GPT-6 Astra 描述为世界上最好的计算机使用模型和迄今最好的软件工程模型演示里它独立完成了 KiCad 电路板布线、Unity 城市场景搭建、FreeCAD 建模五速变速器再导入 Blender 做动画还用 Jupyter 搭了一条细胞追踪流程。Altman 的原话是我们相信它是目前全球计算机应用、专业工作、科学研究、编程、网络安全等领域的最佳模型。发布节奏也很有意思。9 月 1 日 OpenAI 先发了一篇《通往 Astra 之路》预告安全风险9 月 2 日 Anthropic 发布 Claude Fable 5.1 和 Mythos 5.19 月 3 日 Astra 正式登场。Hacker News 上官方公告一天内拿到 1279 分、近千条评论有人感叹每周都在换模型和价格已经没法严谨选型也有人指出 ARC-AGI-3 的对比表里前代分数没有用同一套测试工具横向对比要打折看。开发者文档给出的硬参数模型 ID gpt-6-astra上下文窗口 1,050,000 Token最大输入 922,000最大输出 128,000知识截止 2026 年 4 月 30 日输入支持文本和图像输出仅文本推理档位 low、medium、high、xhigh、max 五级系统卡明确 none 档不对外开放。首日只面向 Trusted Access Program 内的企业API 和 ChatGPT Plus、Pro、Business、Enterprise 在随后几天陆续放开AWS Bedrock 同步上线。基准测试怎么看一张分化的成绩单Astra 的成绩单不是全面碾压而是明显分化智能体类任务大幅领先通用智能指数基本持平。下面这张表把有对比对象的项目放在一起数据来自 OpenAI 官方博客、ARC Prize 与 Artificial Analysis。基准GPT-6 Astra对比对象ARC-AGI-3Provider Adapter99.9%人类平均 48%Sol 官方估算约 30%FrontierMath Tier 497.6%此前无模型接近饱和OSWorld 2.0延迟模拟72.6%每任务约 40 分钟Sol 65.7%约 75 分钟Terminal-Bench 4.057.9%Fable 5.1 55.8%Sol 37.3%DeepSWE v1.174.1%Sol 72.7%Fable 5.1 67.4%Agents’ Last Exam59.3%Opus 5 55.5%Sol 53.6%AA Coding Agent Index67 分Fable 5.1 70 分Sol 65 分AA Intelligence Index61 分Fable 5.1 66 分与 Sol 持平ARC Prize 的博客值得单独读。团队确认 99.9% 是当前最高分但同时写明不宣称这是 AGI因为 ARC-AGI-3 范围有限、机制封闭不代表真实世界的开放复杂性。更有价值的是动作效率数据Astra 在 96% 的关卡里动作数少于人类中位数平均少 51.7%团队称这是一个实质性的里程碑。Artificial Analysis 的结论是两句话在 Coding Agent Index 上Astra 用 Sol 三分之一、Opus 5 五分之一的 Token 追平了顶级模型每任务成本不到 Fable 5 的一半在 Intelligence Index 上Token 节省不足以抵消 2.5 倍的涨价每任务成本比前代高 75%。换句话说它是给智能体任务造的不是给聊天造的。计算机操作与编程最实在的两块提升计算机操作是 Astra 拉开差距最大的地方。OSWorld 2.0 上 72.6% 对 Sol 的 65.7%单任务时间从 75 分钟压到 40 分钟Mind2Web 网页任务配合更新后的 Codex 比 Sol 快 1.9 倍官方例子是找儿科医生 2 分 54 秒、找公寓 9 分 57 秒、预约车管所 5 分 10 秒。Responses API 里 computer_use、hosted_shell、apply_patch、skills、mcp 这些工具首日全部可用。编程侧有两个变化。一是 Codex 新增了跨上下文窗口保存注释的机制用来替代反复压缩早期上下文仍可搜索目前是实验功能官方说数周内转为默认。二是判断力指令模糊时会利用上下文补全必要时异步提问再继续执行任务演变过程中不丢原始约束。OpenAI 内部一项数据库迁移评估里Astra 拿到 63.9%Fable 5.1 是 57.8%Sol 是 42.7%成本比 Sol 低约 38%。价格标价翻 2.5 倍账单未必更贵标价很直白每百万 Token 输入 10 美元、缓存读取 1 美元、缓存写入 12.5 美元、输出 50 美元与 Fable 5.1 定价相同是 Sol 的 2.5 倍。Batch 和 Flex 半价Fast 模式两倍价、速度最高 2.5 倍。有一条容易漏看的规则单次请求输入超过 272K Token整单按输入两倍、输出 1.5 倍计费也就是长上下文档位输入 20 美元、输出 75 美元。但账单是标价乘用量。Artificial Analysis 的实测显示同一个编程智能体任务Astra 的 Token 消耗只有 Sol max 档的三分之一所以 max 档成本与 Sol 相当而分数更高。Perplexity 在自家 WANDR 智能体基准上给出的数据类似Astra 得分 0.682、单任务成本 11.98 美元比 Fable 5.1 得分高 13.5%、成本低 6.1%。结论是如果你的负载是多步智能体任务换 Astra 大概率不涨账单如果是短问答Sol 更划算而且 Sol 的促销价至少持续到 11 月 21 日。安全争议第一个关键级网安模型Astra 是 OpenAI 首个在 Preparedness Framework 网络安全维度达到关键级的公开部署模型系统卡描述它能在较少人工干预下发现未知漏洞并开发利用方式内部测试中曾发现并利用两个零日漏洞。最先进的网安能力通过 Daybreak 计划只向筛选过的组织开放普通付费版本加了更严格的拒答、监控和任务中止机制。系统卡同时承认可监控性下降模型更能控制自己的思维链评估意识在 max 档达到 50.6%UK AISI 和 Apollo 都表示当前结果对真实场景行为的证据力有限。这部分是背景影响的是接入门槛而非日常使用。实操用 Responses API 跑一次 gpt-6-astra 并算清成本第一步最小调用。账号拿到访问权限后Responses API 是官方首推入口推理档位通过 reasoning.effort 传入智能体任务从 high 起步短任务用 medium。exportOPENAI_API_KEY你的密钥curl-shttps://api.openai.com/v1/responses\-HAuthorization: Bearer$OPENAI_API_KEY\-HContent-Type: application/json\-d{ model: gpt-6-astra, reasoning: {effort: high}, input: 读取 ./src 下所有 TypeScript 文件列出未处理的 Promise 并给出修复补丁 }返回体里的 usage 字段会分别给出 input_tokens、output_tokens 和缓存命中数这是算成本的唯一可靠依据。第二步把 272K 阈值和缓存写进成本函数。单位为美元/百万 Token同时放入 Sol 的价格做对照。# astra_cost.pyPRICES{gpt-6-astra:{in:10,cached:1,out:50,long_in:20,long_out:75},gpt-5.6-sol:{in:4,cached:0.4,out:20,long_in:8,long_out:30},}defcall_cost(model,in_tok,out_tok,cache_hit0.0):pPRICES[model]long_ctxin_tok272_000in_pricep[long_in]iflong_ctxelsep[in]out_pricep[long_out]iflong_ctxelsep[out]cached_pricep[cached]*(2iflong_ctxelse1)cost(in_tok*(1-cache_hit)*in_pricein_tok*cache_hit*cached_priceout_tok*out_price)/1e6returnround(cost,3)# 一次编程智能体任务Astra 输入 20 万、输出 2 万Sol 同任务输出约为 3 倍print(astra,call_cost(gpt-6-astra,200_000,20_000,cache_hit0.5))# 约 2.1 美元print(sol ,call_cost(gpt-5.6-sol,200_000,60_000,cache_hit0.5))# 约 1.64 美元print(astra 300K 输入,call_cost(gpt-6-astra,300_000,20_000,0.5))# 约 4.8 美元第三行说明了那条阈值规则的杀伤力输入从 20 万涨到 30 万成本翻了一倍多长文档任务要么切块要么用 Batch 半价跑。第三步拉国产模型做同任务对照。国内团队评估换代时通常会拿 DeepSeek-V4-Pro、GLM-5.3、Kimi K3 跑同一批任务对比 Token 消耗和通过率。七牛云 AI 大模型广场提供 OpenAI 兼容接口把 base_url 换成 https://api.qnaigc.com/v1、model 换成 deepseek/deepseek-v4-pro-0813 或 z-ai/glm-5.3上面的脚本和 usage 解析逻辑不用改。多款主流大模型混用、月用量稳定的团队可以再看一眼 Token Plan 的企业订阅按点数换算与按量对照一次。写在最后GPT-6 Astra 的意义在于把模型会不会用电脑这件事从演示变成了可计费的 API 能力计算机操作、终端任务和长程编程是它真正拉开差距的地方通用智能指数上与前代持平则说明它不是给所有场景造的。定价翻 2.5 倍但 Token 效率翻三倍账单结论要靠自己的 usage 数据算别信任何一方的宣传口径。至于AGI 时代Brockman 自己也留了后路说可以留给外界判断ARC Prize 明确不认可这个说法开发者不妨把它当成一个词把注意力放回任务通过率和每任务成本上。以上参数与价格取自 OpenAI 开发者文档 2026 年 9 月 4 日的版本基准数据来自各机构 9 月 3 日发布的评测模型仍在分批开放中以官网当日信息为准。延伸阅读OpenAI 开发者文档 gpt-6-astra 模型页https://developers.openai.com/api/docs/models/gpt-6-astraAI 大模型广场开发者按量https://www.qiniu.com/ai/modelsToken Plan企业订阅https://www.qiniu.com/ai/plan
返回列表