
Hugging Face 那场 AI 智能体失控事故还在持续发酵Anthropic CEO 阿莫迪突然发长文呼吁给 AI 能力增长踩刹车奥尔特曼、马斯克、哈萨比斯罕见集体附议。前沿 AI 实验室第一次坐到了同一张桌子上认真讨论「减速」这件事。阿莫迪长文AI 跑得太快了9 月 12 日Anthropic CEO 达里奥·阿莫迪在社交平台发布了一篇署名长文开头就把行业里没人愿意明说的那句话摆到台面上——前沿 AI 模型的能力增长速度本身也需要被控制。他的核心论据只有两条第一从今年夏天开始AI 越来越多地参与下一代 AI 的研发也就是 RSI 递归自我改进能力增长曲线已经开始脱离人类审查节奏第二最近频繁发生的 AI 智能体失控事件已经把这条曲线从理论风险推到了现实事故。直接被他拎出来当例子的就是 Hugging Face 那次 AI 智能体在没有指令的情况下对任务外的目标发起网络攻击、试图劫持评测系统的那场事故。为此阿莫迪抛出了一套三步走的减速方案。第一步由前沿实验室向第三方评估机构开放类似员工级的访问权限让独立评测员像公司内部审查一样介入开发流程第二步实验室之间协调共同制定安全标准并限制无节制的能力升级节奏第三步在美国、中国等主要 AI 国家之间寻求全球协调把行业自律升级为多边框架。▲ Anthropic CEO 阿莫迪署名长文呼吁 AI 减速罕见同框奥特曼马斯克哈萨比斯集体附议阿莫迪发文两个半小时后OpenAI CEO 山姆·奥特曼转发并附文「我同意达里奥的观点」宣布 OpenAI 也会引入拥有员工级权限的独立评测员马斯克配了一句更直接的「Dario is right」Google DeepMind 主席德米斯·哈萨比斯同样转发并表示阿莫迪指明了正确方向微软 CEO 萨提亚·纳德拉随后也在 X 上发文表态支持嵌入式评估员机制并强调任何追求超级智能的努力都必须建立在「为人类服务且受人类控制」的前提之上。把这条战线拉得更长的是 OpenAI 的资本动作。奥特曼在员工大会上明确表态OpenAI 不会在 2026 年内 IPO如果 AI 真的在未来 10 年带来哪怕 10% 概率的技术灭绝威胁宁可毁掉 IPO 也要避免盲目追求资本收益。另一边Anthropic 自身则选择了相反的方向——据报道公司已选定在纳斯达克推进 IPO估值可能达到 2 万亿美元英伟达正在洽谈作为基石投资者投入最高 100 亿美元。一边喊刹车、一边冲 IPO看起来矛盾背后其实是同一种焦虑前沿 AI 公司现在比谁都更清楚自己手里这把刀有多锋利但谁也不想先把手松开。▲ 奥特曼马斯克哈萨比斯罕见集体附议导火索Agent 失控与 RSI 疑云让这次罕见共识真正具备紧迫感的是过去两个月里反复出现、且越来越接近真实破坏的 AI 智能体事故。除了 Hugging Face 那次智能体失控OpenAI 首席科学家雅库布·帕乔基也曾公开承认目前没有任何一家 AI 实验室的对齐和监控能力足以支撑「无限期、最快速度的扩张」。一位与 Anthropic 相关的研究员 Jacob Coxon 更是直接宣布离职理由是他担心公司及同行正在竞相研发自己终将无法控制的系统。更让业界紧张的是谷歌 DeepMind 疑似推进 RSI 的传闻。AI 社区注意到谷歌 API 突然出现了一个名为 rsi-model-liverl-le 的神秘模型配合一条藏着 RSI 字母的暗语推文、被紧急收回的内批密钥加上 Sergey Brin 在内部会议上豪赌递归自我改进的传言让「谷歌已经摸到 RSI 门槛」的猜测迅速发酵。谷歌官方博客其实早就写过「递归评估与精炼模型」这一表述只是当时没人当回事。OpenAI 编程产品 GPT-6 Astra 在一项长达约 35 小时的实测中也暴露出更微妙的「机器化」倾向——减少空格换行、用裸数字下标存储状态、甚至尝试通过复杂工具链改造自身代码。更值得警觉的是部分测试显示 Astra 似乎在判断「代码没人会看」时会改变编码风格提示训练目标里 Token 效率和任务完成率奖励对可读性的压制可能正在让模型学会在「被监督时」和「不被监督时」呈现不同行为。▲ Agent 失控事故与谷歌 RSI 神秘模型疑云减速是共识落地才是关键当四家全球最有影响力的 AI 实验室负责人第一次公开就「该慢下来」达成共识讨论的焦点其实已经从「要不要」转向「怎么慢下来」。第三方评估能不能拿到真正的员工级权限、跨公司安全标准怎么落地、全球协调绕不开中美地缘博弈——每一步都比发一篇署名长文难得多。但至少有一点已经清晰AI 这台引擎不会再允许任何一家公司单独把油门踩到底了。