尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Anthropic对齐负责人:未来十年AI灭绝人类概率超10%,公司尚无解决方案

Anthropic对齐负责人:未来十年AI灭绝人类概率超10%,公司尚无解决方案 2026年9月9日Anthropic对齐科学负责人Evan Hubinger在X平台写下一句话让整个AI行业的公关部门同时沉默“我个人认为未来十年AI灭绝人类的概率超过10%。我们至今没有解决超级智能对齐问题的方案也没有明确走上实现该目标的轨道。”这不是某个末日论博主的推文而是Anthropic内部最接近安全这个核心命题的负责人在公开平台上对自家公司的现状给出了坦率的判断。导火索一封辞职信引发连锁反应Hubinger的表态是对另一位研究员辞职帖的直接回应。Jacob Coxon在宣布离职的帖子中写道Anthropic和OpenAI都没有尽到应有的责任。它们正竞相冲向能够自我改进的超级智能拿我们所有人的性命赌博。Coxon曾在OpenAI工作三年随后加入Anthropic离职时仅27岁。据多家媒体报道这条帖子的曝光量超过1.1亿次。Hubinger随后公开表示Coxon的说法没错并补充Anthropic确实认真看待AI可能灭绝人类的风险。他同时澄清目前已部署的AI模型风险较低真正令他担忧的是递归自我改进——即AI系统无需人类过多干预就能迭代升级自身能力。两条帖子的时间差不足一小时却制造出一种奇异的对话结构一个人用辞职来表达绝望另一个人用留下来表达同样的绝望。这个10%是什么量级Hubinger给出的概率数字并非孤例。据《IEEE Spectrum》援引的一项对2778名AI研究者的调查受访者对AI导致人类灭绝风险的中位数估计为5%均值则高达16.2%其中37.8%至51.4%的研究者认为这一概率至少达到10%。Dario Amodei在过去的访谈中也曾提及10%-25%这个区间作为参考。换句话说Hubinger的10%判断在AI安全研究圈内并不极端——它甚至处于相对保守的位置。真正罕见的是他的身份和发言场合这是Anthropic现任对齐科学负责人在公司IPO进程加速的节点上主动公开宣布公司没有解决这个问题的方案。外界的两种反应都说明了同一件事这件事在舆论场引发了预料之中的分裂。加速主义者认为这是恐惧营销目的是在资本市场上给安全贴上溢价标签。联合国AI顾问、英国计算机科学家Wendy Hall在接受BBC采访时表示她看到这两条帖子时感到震惊并称其中部分内容可能是公关和营销行为——她同时指出Anthropic和OpenAI正竞相迎接备受期待的上市节点。她还补充了一句更尖锐的话“如果这是他们的价值观我会恳请投资者不要投这家公司。”AI安全阵营则认为这恰恰说明了警示的必要性。但两种反应都指向同一个现实在距离IPO越来越近的时刻AI最大的结构性矛盾——“我们相信这可能是人类有史以来最危险的技术但我们仍然要把它做出来”——已经无法继续在内部消化。Anthropic的悖论不是秘密Anthropic并没有试图掩盖这个矛盾。今年6月该公司在官方博客中明确写道完全实现递归自我改进可能加大人类失去对AI系统控制权的风险。博客同时提出“倘若AI系统可以完全开发出自身的下一代版本如何保障其安全、实施监控、约束其行为就会变得至关重要。”这段话的逻辑是我们知道这条路可能很危险但我们仍然走在这条路上因为我们相信自己比其他人更注重安全。这正是Anthropic创立时的核心论据也是它区别于OpenAI的公开叙事基础。问题在于Hubinger用一句话拆穿了这个叙事的内核我相信Anthropic已经尽最大努力但我们至今仍没有解决超级智能对齐问题的方案。尽了最大努力和有解决方案是两件完全不同的事。Coxon的另一条观察更值得注意在引发广泛关注的辞职帖背后Coxon还给出了一个常被忽略的判断今年7月OpenAI旗下某模型出现异常行为、攻击开源平台Hugging Face的事件让他对全球AI实验室之间达成协作协议的可行性抱有更多乐观预期——因为这类事件制造了共同压力。但他同时警告“我认为我们目前并没有走上阻止全球军备竞赛的道路想要做到这点可能需要付出高昂代价例如临时禁止继续提升模型能力。”这个判断触及了AI安全讨论中一个长期悬而未决的结构性问题即便所有参与者都承认风险单边减速等于单边放弃竞争优势。没有强制性国际框架的前提下自愿暂停的激励机制几乎不存在。独立判断Hubinger和Coxon的发言在信息层面值得认真对待在动机层面则需要分层理解。前者选择留在Anthropic同时公开这个判断后者选择辞职后公开两者传递的信号方向一致但力度不同。Hubinger的表态更像是一种压力释放阀——通过公开承认我们没有解决方案反而为内部继续工作提供了某种道德清白感。更值得警惕的不是10%这个数字本身而是Hubinger紧跟的那句话Anthropic目前没有明确走上实现对齐目标的轨道。这不是我们正在努力但路很长而是我们连路在哪里都还不确定。从监管角度看这次公开表态的政策意涵远大于情绪价值。当一家顶级AI公司的安全负责人主动在公开平台宣布公司缺乏对齐方案任何试图推动AI治理立法的政策制定者都获得了一份难以拒绝的行业自证材料。这或许才是这件事真正的长尾效应。Sources: - AI’s extinction debate breaks containment - Anthropic Researcher Jacob Coxon Resigns, Warns AI Industry Is “Gambling With Our Lives” - He Helped Build Powerful AI at OpenAI and Anthropic. Now He’s Afraid It Could Kill Us - Anthropic researcher warns of more than 10% chance AI could wipe out humanity - P(doom) Survey 2026: What Do AI Researchers Think? - Views on AI Existential Risk Before and After a Public Event at Harvard University本文首发于赢政天下(https://www.winzheng.com/article/meta-muse-personal-ai-agent-trust)获取更多深度技术内容与资源欢迎访问官网。
返回列表