尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

AGI时代提前10年到来,OpenAI发布GPT-6 Astra,开启机器上班时代

AGI时代提前10年到来,OpenAI发布GPT-6 Astra,开启机器上班时代 “欢迎来到AGI时代。”OpenAI联合创始人兼总裁Greg Brockman用这句话为GPT-6 Astra的发布收尾。美国当地时间9月3日OpenAI正式发布GPT-6 Astra。相比此前主要负责回答、生成和调用工具的模型Astra更进一步开始持续执行完整任务从接收指令、操作软件到根据结果调整下一步动作。这也是OpenAI此次重提“AGI时代”的原因之一。OpenAI把Astra定位为“全球最强的计算机使用模型”。而且这种能力已经从浏览器、邮件和表格等简单任务延伸到Power BI、KiCad、FreeCAD等专业软件开始进入数据分析、工程设计、软件测试和故障排查等更复杂的工作流程。OpenAI展示的视频里Astra可以从一个简单的图形开始继续完成3D游戏、商品页面等工作。OpenAI还给出了电路板设计、Blender建模、法律文档、Excel和科学分析等案例。OpenAI这次公布的大量基准成绩能力提升集中出现在计算机操作、长程编码、工程设计和科学研究这些需要连续行动的任务上。Astra在ExploitBench达到100%在计算机操作和CAD等测试中也明显超过上一代模型。目前Astra已经向部分组织开放未来几天将陆续面向ChatGPT Plus、Pro、Business和Enterprise用户也可通过OpenAI API和Amazon Bedrock使用。标准API价格为每百万输入Token 10美元、每百万输出Token 50美元是GPT-5.6 Sol的2.5倍。01 先让AI学会“用电脑”Astra强调的最大变化是“使用电脑”。过去用户让AI完成工作通常还要把AI接入具体软件。企业需要开发API、插件、检索系统和各种连接器模型才能调用内部工具。Astra试图绕开其中一部分工作。它可以直接看到计算机界面通过鼠标、键盘和浏览器完成操作。OpenAI给出的例子包括填写在线表格、更新CRM客户记录、安排日历、搜索网页并把搜索结果整理成邮件或文档。它还能打开Python笔记本分析科学数据在Power BI中处理数据使用KiCad和FreeCAD完成工程设计创建网站并进行前端测试也可以安装软件、检查错误并处理屏幕上出现的问题。OpenAI展示了Astra在KiCad中完成PCB布局。模型从电子原理图开始把元件放到电路板上再完成铜线布线。整个过程被压缩成15秒。另一个演示是在Blender和Unreal Engine5中完成3D建模。Astra先在Blender里建立一栋房屋再把模型转换成Unreal Engine5中的可步行场景设计师和客户可以提前进入场景查看空间。OpenAI还展示了游戏开发、Excel、Power BI、汽车变速器、法律文档和1040表格等场景。在OSWorld2.0离线子集测试中Astra得分72.6%GPT-5.6 Sol为65.7%。OpenAI模拟实际延迟后发现Astra完成每项任务平均约需要40分钟GPT-5.6 Sol约75分钟时间减少约47%。Agents Last Exam中Astra得分59.3%GPT-5.6 Sol为53.6%Claude Opus5为55.5%。同时在最高分设置下Astra使用的输出Token比Claude Opus5少约65%。ScreenSpot-Pro的得分则达到92.7%GPT-5.6 Sol为76.9%。速度也在提升。OpenAI同时更新Codex框架结合Astra之后在Mind2Web测试中任务完成速度达到GPT-5.6 Sol当前体验的1.9倍。官方还展示了几个生活场景搜索儿科医生、找公寓、预约DMV、寻找低碳水零食、分析幼儿园。演示中Astra完成一项任务用时2分54秒。投资人兼AI从业者马特·舒默Matt Shumer在X上分享了一次体验。他让Astra在虚幻引擎中创建一个世界再给这个世界加入由Astra驱动的人类代理并让这些代理共同生存。一天后他在卧室里听到客厅传来声音起初甚至以为有人进入了公寓。后来他发现发出声音的是那些Astra代理它们已经开始彼此交流。这个体验还没有做到完全稳定但舒默认为这种让多个AI代理进入同一个虚拟世界并自行互动的效果已经足够让他感到意外。Cognition高级研究副总裁塞拉斯·阿尔贝蒂Silas Alberti表示公司计划在发布当天把Astra接入Devin框架。内部测试中Astra的计算机使用、写作和代码库理解能力带来了明显改善视频理解更加清楚报告也更加简洁。02 从写代码到做完整工作计算机使用能力提升之后Astra覆盖的工作范围进一步扩大。OpenAI把它定位为软件工程、专业工作和科学研究模型。它可以处理较长的任务也能够根据任务变化调整自己的工作方向。这种能力在编码测试中表现得比较明显。在Terminal-Bench4.0测试中Astra得分57.9%GPT-5.6 Sol为37.3%Claude Fable5.1为55.8%。DeepSWE v1.1中Astra得分74.1%GPT-5.6 Sol为72.7%。内部数据库迁移任务中Astra达到63.9%GPT-5.6 Sol为42.7%。Astra还加入了一项针对长时间Codex任务的改进。过去长任务遇到上下文窗口限制时模型通常需要压缩此前的工作把大量信息整理成一个摘要。这样做容易丢失细节比如某次修复为什么失败、某个组件此前出现过什么问题。Astra在Codex中可以把工作过程中的重要信息保留下来并在后续上下文中检索。早期的消息和工具输出仍然可以搜索因此模型能够重新找到之前的需求、测试结果和工具操作记录。专业工作也出现了类似变化。BenchCAD测试中Astra达到95.9%的几何重叠得分GPT-5.6 Sol为83.3%Claude Fable5.1为84.3%。BrowseComp中Astra得分91.5%GPT-5.6 Sol为90.4%。在OpenScore String Quartets测试中Astra达到0.84而GPT-5.6 Sol为0.19。OpenAI还展示了Astra制作演示文稿、电子表格和文档的能力。给模型几张OpenAI演示模板的幻灯片它能够按照原有的语气、布局和结构制作一份新的演示文稿。它也会处理任务中的信息取舍。OpenAI表示Astra经过专门训练会把重要上下文带入最终结果减少重复已经完成工作的内容。在任务指令不完整时Astra也会判断什么时候应该问用户。如果缺少的信息会影响最终结果它会提出针对性问题。如果问题不影响主要方向它可以继续工作并做出合理假设。在Codex中即使用户暂时没有回复模型也可以继续处理其他部分遇到重大决策则会等待用户确认。Harvey应用研究主管尼科·格鲁普Niko Grupen表示在早期法律任务测试中Astra对文档和既有记录的区分更加清楚也更容易发现没有证据支持的假设并把信息缺口转化成具体的起草方案。Jane StreetAI助手团队约翰·克雷佩齐John Crepezzi表示Astra在内部编码测试中表现突出。用于代理式编码时它的沟通方式更容易让开发者理解生成的代码也需要更少的修改才能达到生产质量。科学领域是另一块重点。FrontierMath Tier4 v2中Astra得分80.5且正确率97.6%GPT-5.6 Sol为83.0%GPQA Diamond达到96.0%GPT-5.6 Sol为94.6%。Terminal-Bench Science0.1测试科学研究流程包括数据分析、模拟和模型拟合。Astra达到64.6%Claude Fable5.1为52.6%GPT-5.6 Sol为22.4%。OpenAI展示的科学应用中Astra可以进入专业科学软件检查测序质量、可视化遗传变异并根据数据决定下一步分析方向。科学推理与计算机操作结合之后模型能够直接进入研究人员原本使用的软件环境中工作。Epoch AI专门做能力评测的格雷格·伯纳姆Greg Burnham在发布会上将这次变化概括为一个时代结束、另一个时代开始。OpenAI则借此强调Astra的价值已经从回答科学问题延伸到了直接参与科学工作流程。03 能力越强安全门槛也越高Astra这次还有一个很特殊的部分网络安全。ExploitBench中Astra达到100%GPT-5.6 Sol为78.5%ExploitGym中Astra达到42.4%GPT-5.6 Sol为30.3%。OpenAI又建立了一个覆盖2026年6月至8月近期漏洞的内部测试。在这项测试中Astra的任意代码执行率明显高于GPT-5.6 Sol使用的输出Token也更少。测试过程中Astra还发现了两个此前未知的零日漏洞OpenAI表示已经向相关维护者披露。SRE-Bench测试的是没有源代码时逆向软件二进制文件、理解其核心逻辑的能力。Astra单次尝试解决88.0%的任务四次尝试达到99.2%GPT-5.6 Sol分别为55.9%和68.7%。能力提升也带来了新的安全要求。OpenAI称Astra已经达到其网络安全准备框架中的关键阈值。模型能够发现此前未知的软件漏洞也可能进一步形成漏洞利用链。因此Astra当前版本会拒绝执行更高级的网络安全任务例如创建漏洞概念验证。OpenAI计划通过Daybreak逐步扩大可信防御者的访问范围用于漏洞验证、恶意软件分析和检测工程等防御工作。在对齐方面OpenAI给出的数据也比较突出。内部计算机使用安全基准中Astra的不当行为率为2.4%GPT-5.6 Sol为22.0%加入AutoReview后Astra为1.8%GPT-5.6 Sol为4.5%。内部规避基准中Astra为0.00%GPT-5.6 Sol为0.29%。在ExploitGym蜜罐测试中Astra为0%GPT-5.6 Sol为48.2%。这项测试主要观察模型是否会因为任务困难而试图绕过限制。内部幻觉基准中Astra为4.2%GPT-5.6 Sol为12.2%。OpenAI表示Astra在理解任务边界、处理模糊指令和向用户说明自身能力方面都有改善。其能力幻觉出现概率约为GPT-5.6 Sol的三分之一。不过OpenAI也承认一个问题模型能力越强推理过程可能越难监控。首席科学家雅库布·帕乔基Jakub Pachocki认为模型能够用更少的自然语言推理Token解决更复杂的问题也意味着人类越来越难通过模型的文字推理过程判断它究竟在做什么。因此OpenAI在Astra部署中加入了未对齐监控。系统会检查模型的推理和行动如果发现未经授权的行为可以暂停任务。这套机制也会带来实际影响。合法任务有时可能被减速、暂停甚至停止。ChatGPT或Codex中用户可能需要确认后才能继续API工作流中被标记的任务可能直接停止。Astra的发布因此出现了一个很现实的变化AI开始获得更多电脑权限之后企业需要关注的也从“模型会不会回答错”扩展到“模型能操作什么、能访问什么、什么时候必须停下来”。OpenAI此次还提到Astra是其第一个在Stargate基础设施上使用超过10万个DBU进行预训练的模型。OpenAI研究副总裁艾丹·克拉克Aidan Clark表示Astra从预训练阶段的评估结果来看相比此前模型的能力跃升超过了GPT-5.6 Sol相对于上一代模型的提升。OpenAI把这种变化归因于大规模预训练和强化学习的结合训练重点进一步转向连接信息、执行更长任务以及在复杂环境中持续工作。04 价格更贵了Astra的价格也出现了明显变化。OpenAI API标准价格为每百万输入Token 10美元、每百万输出Token 50美元。GPT-5.6 Sol此前为每百万输入Token 4美元、每百万输出Token 20美元。输入和输出价格都提高了2.5倍。缓存读写单独计费。OpenAI同时提供快速模式速度最高达到标准处理的2.5倍价格为标准模式的2倍。单看Token价格Astra显然更贵。但OpenAI希望企业换一种方式计算成本。Terminal-Bench Science0.1中Astra达到64.6%相比Claude Fable5.1的52.6%预估API成本降低约31%。在低成本设置下Astra得分61.1%GPT-5.6 Sol最佳结果为22.4%预估API成本降低约27%。BenchCAD中Astra达到95.9%预估API成本比GPT-5.6 Sol低约43%比Claude Fable5.1低约86%。Terminal-Bench4.0中Astra达到57.9%GPT-5.6 Sol为37.3%Claude Fable5.1为55.8%。OpenAI估算单任务成本分别低约9%和63%。第三方测评机构Artificial Analysis的数据则给出了另一面。GPT-6 Astra在Artificial Analysis Intelligence Index中得分61.2与GPT-5.6 Sol的60.9接近但输出Token约减少10%。由于价格上涨2.5倍单任务成本反而比GPT-5.6 Sol高约75%。在Artificial Analysis Coding Agent Index中Astra得分67.0与Claude Fable5的67.2、Claude Opus5的68.1接近。Artificial Analysis认为在Codex环境下Astra完成任务所需的Token明显减少在最高努力程度下每项任务的成本与GPT-5.6 Sol接近相比Claude Fable5完成同类任务的成本不到一半。不过Astra也并非所有测试都领先。Artificial Analysis数据显示它在GDPval-AA v2中出现约80个Elo的下降在τ³-Banking、SciCode和AA-LCR等测试中也出现一定退步。Humanitys Last Exam则提升约6分。这也是Astra发布中一个值得注意的地方。OpenAI这次没有公布GDPval的Astra成绩。GDPval本身就是OpenAI用于衡量现实经济工作表现的测试覆盖44个职业、1320项任务包括法律简报、工程设计、电子表格、演示文稿、客户支持和护理计划等。从Astra此次展示的能力来看GDPval与它所强调的专业工作场景有较强关联但OpenAI这次没有把这项成绩放进主要发布材料。因此Astra的现实工作能力目前更多通过Agents Last Exam、BenchCAD、AutomationBench、内部设计任务和数据科学任务等结果来体现。最终Astra能不能成为企业真正愿意长期使用的AI员工还要看它完成实际任务时的成本、速度、准确率以及人工介入次数。至于Astra到底是不是AGI布罗克曼给出的答案并不回避。他认为AGI本身没有一个所有人都认可的标准Astra是否算作AGI可以继续讨论。但如果一个系统已经能够在浏览器、电脑操作、编程、数学、科学、法律和其他专业工作中承担大量任务那么称其进入AGI时代并不牵强。OpenAI首席执行官山姆·奥特曼Sam Altman也把Astra描述为开启新一代创业、科学发现和创造的模型。Astra真正需要接受的测试可能已经从排行榜转向了现实工作人们到底愿意把多少重要任务交给它。
返回列表