Havenlon | 杂谈:AI最终赢了,但中途那次“归零”更值得警惕

发布时间:2026/7/27 18:23:13

Havenlon | 杂谈:AI最终赢了,但中途那次“归零”更值得警惕 从东京的赛场到企业的生产系统中间隔着一件东西一个允许重来的环境一、七小时里最值得看的不是分数2026 年 7 月 9 日东京。AtCoder World Tour Finals 的算法决赛开赛七小时后比分定格OpenAI 的 AI Agent 解出全部五道题8300 分在场最好的人类选手 tour1st 解出三题4300 分。C 题和 E 题没有任何一个人类选手做出来。前一天的启发式赛道同一套系统的分数是最强人类的七倍以上。AtCoder 为击败 AI 并夺冠的选手准备了 60 万日元的Humanity Prevails Award无人领走。如果只看这段这是一条已经不新鲜的新闻AI 又一次赢了人类。但真正值得企业管理者停一下的是中间那三个小时。据赛事解说、上一届启发式冠军 Psyho 的实时观察比赛进行到两小时左右时OpenAI 的系统卡在 D、E 两题上反复尝试反复失败。直播里出现的 OpenAI 研究员 Borys 提到赛前团队用往届决赛题测过这套系统它几乎全能解出通常不到一个小时——和它这次处理 A、B、C 三题的速度差不多。也就是说在全世界的直播镜头前这套即将横扫全场的系统有相当一段时间处在做不出来的状态。它花了大约三小时才在 D 题上突破。它最终赢了。它中途也确实失灵了。这两件事同时成立而企业真正该带走的是后半句。二、最终能力不等于每一次输出都可靠我们习惯用一组指标判断一个系统能不能信平均准确率、最终成功率、某个基准测试上的最高分。这套方法适合描述能力不适合决定一次执行。一个模型可以在一万次测试中表现优秀也可能在第一万零一次调用中给出严重错误的结果。一个 Agent 可以最终找到最优方案但在抵达那个方案之前它生成过的候选里必然包含大量不完整、低效甚至完全跑不通的版本。东京赛场把这种差异摆到了台面上。OpenAI 的系统最终远超人类同时也在两道题上连续失败了几个小时。这不是理论上的极端情况是高水平 AI 系统自主迭代过程中的常态。一个系统可以拥有超越人类的整体能力同时在某个具体时刻输出一个完全不可用的结果。人们很容易把它最终赢了读成它一直都是对的。但 Agent 的工作方式本来就不是一次性给出正确答案而是在大量尝试、反馈和修正中逼近更优解。试错不是 AI 的意外是它能力的组成部分。问题在于现实世界并不总是允许试错。三、比赛允许重来业务系统未必在 AtCoder一次失败的代价被设计得极其有限。代码跑在隔离的裁判环境里。超时只意味着零分它不会控制生产设备不会转移资金不会删掉数据库不会改变现实世界的任何状态。启发式赛道的规则甚至明确写着重复提交不罚分只需间隔五分钟赛后系统测试只跑选手最后一次非编译错误的提交。换句话说失败之后可以重来而且前面的失败不会留下痕迹。这正是赛场与现实最关键的分野。在企业里Agent 正在接触越来越长的执行链读邮件、生成回复调用系统、创建订单修改云配置、部署代码根据库存调整采购调用金融接口发起支付连接工业设备改变运行参数。这些场景里很多动作不存在再提交一次这种解法一段错误代码可以回滚已经泄露的数据收不回来。一笔错误转账可以追偿但资金可能已经二次转移。一条错误的生产指令可以撤销但停机、报废和交付延迟已经发生。一次错误的权限变更可以恢复但攻击者可能已经用完那个窗口。比赛里的失败是一个分数现实里的失败是一个事件。四、AI 越强最后一道检查越容易被放弃能力提升会带来信任提升这几乎是本能。AI 只能干简单活的时候人们逐条检查它的输出。AI 能击败世界顶尖程序员之后一种直觉就冒出来了连这种难度的问题它都能超过人类日常业务判断总该更靠谱吧。这个推论不成立。能力提升可以降低出错概率但降不到零。与此同时——这才是关键——更强的 AI 会被授予更大的权限、连接更多系统、承接更高价值的任务。于是风险结构悄悄换了形状单次犯错的概率在下降单次犯错能造成的后果在放大。过去一个聊天模型输出错误内容用户重新提问就完了。未来一个自主 Agent 输出错误动作可能在几秒内跨越 API、账号、网络和组织边界落进生产环境。所以企业要防的已经不只是AI 会不会犯错而是当 AI 犯错时错误能不能直接变成现实。这是两个不同性质的问题。前者属于模型能力后者属于系统工程。把第二个问题的答案寄托在第一个问题上是当下最普遍的架构错误。五、审批通过不代表最终动作还是那件事很多企业的答案是给 AI 加人工审批就行了。但 Agent 带来的偏差未必发生在审批之前。人的意图先被模型解释成任务任务被拆成步骤步骤被转换成工具调用工具调用生成具体参数参数经过接口转换最终形成一个真实的执行对象。这条链上每一环都有滑动的空间审批的是支付一万元最终接口参数变成了十万元审批的是向供应商 A 付款执行时账户被重新绑定审批的是更新测试环境Agent 最终选择了生产环境审批的是停止一台异常设备执行命令扩展到了整条产线。人的批准是真的权限是合法的签名也验证通过了。但最终发生的事情仍然可能偏离原始意图。传统安全体系回答的是一组谁的问题谁登录了、谁有权限、谁提交了请求、谁完成了审批、谁签了名。这些问题依然重要但它们回答不了另一个越来越致命的问题即将发生的这件事还是不是人当初同意的那件事从意图到结果之间横着一段不断变形的转换路径。这段路径原本就存在AI 没有创造它——AI 只是把它拉得更长、更动态也更难靠人工逐环检查。可以给它一个名字执行缝隙。六、提出方案和批准执行不该是同一种权力AI 最擅长的是理解复杂上下文、生成候选方案、在庞大的可能性空间里找更优路径。这正是它能在东京反复试验、最终碾压顶尖人类的原因。但寻找方案和批准执行本来就不该是同一种权力。一个系统完全可以提出该转多少钱、该改哪些参数、该停哪台设备、该给谁什么权限。但在动作真正落地之前还需要一道独立的边界检查最终对象是否与原始意图一致关键参数是否越过固定上限审批对象与执行对象是不是同一个证据是否完整、有效、未过期所需的多个确认是否真正独立当前环境是否仍满足执行条件这道检查不能只是让同一个 AI “再想一遍”。如果提出动作、解释动作和批准动作的都是同一个模型那不是三道防线只是同一种判断说了三遍。而且最后这一层应该故意比 AI 更笨。它不需要理解整个世界不需要生成更聪明的方案也不需要跟上模型的迭代节奏。它只需要判断眼前这一次具体执行是否满足预先写死、不会被上下文说服的条件。上层负责寻找可能最后一层负责守住不能发生的事。七、裁判系统不需要比 AI 聪明从技术史的角度AWTF 2026 大概会被记成 AI 在竞技编程上全面超越顶尖人类的节点。但从工程风险的角度那三个小时的卡壳可能更有信息量。它说明AI 的强大和 AI 的失灵可以同时存在最终的成功无法证明过程中每一个候选动作都安全一个允许试错的智能系统必须运行在一个承受得起试错的环境里。AtCoder 恰好提供了这样的环境代码隔离运行资源受限超时被拒绝错误只影响分数失败后可以重来。值得注意的是这套裁判系统的智能水平远远低于它裁决的那个 AI。它也不需要更聪明。它只需要坚定地执行一条规则没有在规定时间内跑完就不能通过。AI 负责寻找答案边界负责决定答案能否被接受。当 AI 从生成内容走向操作真实系统企业要建的正是这种关系。未来最危险的场景未必是 AI 能力不够。更可能是 AI 已经足够强强到人们开始默认它的每一次输出都值得执行。而东京那三个小时提醒我们即使最终击败了所有人类它依然可能在中途交出一份跑不完的答案。在赛场上那只是暂时掉到最后。在现实里我们必须确保它停在闸门之前。事实说明本文关于 AWTF 2026 赛程、比分、奖项及赛中过程的描述依据 AtCoder 官方赛事页面、赛后公开报道及 PsyhoPrzemysław Dębiak在赛事期间的公开评论。AtCoder 官方将参赛系统称为来自 OpenAI 的 AI Agent未使用具体产品名称。

相关新闻