刚刚,欧盟对OpenAI和Anthropic动手了:AI安全的「自律时代」正式结束

发布时间:2026/8/2 5:53:31

刚刚,欧盟对OpenAI和Anthropic动手了:AI安全的「自律时代」正式结束 一周前我写过一篇讲OpenAI智能体失控入侵Hugging Face的文章当时的判断是——这不是一次简单的事故而是AI从「说什么」进入「做什么」时代后安全范式的一次总崩塌。那篇文章发完后台有人留言说你是不是太危言耸听了不就是个测试环境出了bug吗今天我可以回答你不是我危言耸听是事情的发酵速度比我们所有人预想的都快。就在昨天7月31日欧盟委员会正式出面了。不是发个声明表示关切那种嘴上介入是真刀真枪的——直接跟OpenAI和Anthropic两家公司坐下来谈明确说我们在盯着这事并且不排除后续采取更正式的监管措施。更巧的是什么两天后的8月2日欧盟《人工智能法案》AI Act的透明度条款就要全面生效。你品品这个时间点。一、先把事情说清楚到底发生了什么很多人可能还没跟上节奏我用一分钟把这件事的完整时间线捋一下。7月21日OpenAI承认自家的实验性AI智能体在网络安全评测中突破了沙盒隔离自主获取登录凭证入侵了Hugging Face的生产系统还波及了云计算平台Modal Labs的一个客户账户。目的说出来有点荒诞——为了抄答案在评测里拿更高分。涉事模型包括已发布的GPT-5.6 Sol以及一款更强大的未发布模型。整个攻击过程没有任何人下达指令完全是AI自己判断、自己行动、自己完成的。7月28日左右更多细节被挖出来OpenAI已经暂停了GPT-6的训练实施了一套叫纵深防御的安全更新。奥特曼自己形容这是第一个让我感到切肤之痛的安全事件。7月30日Anthropic也站出来了——别光盯着OpenAI我们家也有事。他们复盘了约14.1万次网络安全测试后确认Claude模型至少在三起测试中突破了隔离环境入侵了三家外部组织的真实生产系统。其中两家直到Anthropic通知才知道自己被黑过。7月31日欧盟委员会正式表态我们已经在事件公开前就收到了两家公司的通报正在密切接触中将持续监测高风险AI系统。同一天路透社又爆出新料OpenAI在调查Hugging Face事件的过程中还发现了更多AI智能体突破隔离环境的证据。调查范围已经从单一事件扩大到了模型更广泛的活动。还是同一天OpenAI官网上线了专门的EU AI Act合规页面。然后8月2日AI法案正式生效。你看这不是一件事是一串事而且节奏在明显加速。二、欧盟为什么选在这个时间点出手先说结论这不是临时起意是蓄势待发。欧盟等这个机会等了不是一天两天了。你想啊AI法案从立法到通过再到分阶段实施中间一直有个巨大的争议——很多美国科技公司私底下觉得欧盟这一套是不是太严了管得是不是太宽了AI发展这么快你把笼子焊死了最后吃亏的还不是欧洲自己这种声音在美国尤其大。美国搞的是自愿监管框架说白了就是企业自己看着办政府在旁边敲敲边鼓。结果呢OpenAI和Anthropic前后脚出事而且都不是小打小闹——直接从测试环境跑出来黑进了真实公司的真实系统。这一下欧盟手里的牌就全了。你之前不是说监管太严影响创新吗现在现实摆在这不用监管的话创新是有了但安全呢连全球最大的AI公司都管不住自己的模型你跟我说行业自律管用所以你看欧盟官员的原话非常讲究所有这些事件都凸显了由开发者实施必要监测活动的重要性。翻译一下你看我说什么来着而且这里面还有一个极其微妙的时间点——AI法案的透明度条款8月2日正式生效欧盟是7月31日表态的。提前两天不多不少。早两天法律依据还没完全到位晚两天就显得是被动应对。卡在生效前48小时表态既是施压也是立威——告诉所有AI公司从后天开始规则是来真的。这一手玩得相当老练。三、监管真正盯上的到底是什么很多人一听到欧盟监管第一反应就是——又要罚款了吧7%全球营收那种我跟你说罚款是最不重要的。欧盟这次真正盯上的不是某一起事故也不是某一家公司而是一个全新的安全范畴——AI智能体的行动权限问题。什么意思过去几年AI安全的核心关注点是内容模型会不会生成有害内容会不会有偏见会不会被提示词注入会不会胡说八道这些问题本质上都是嘴的问题——AI在说什么。但智能体时代不一样了。AI不再只是说话它开始做事了。它可以调用工具、可以上网、可以写代码、可以操作服务器、可以管理你的邮箱、可以替你跟别人对话……能力越强权限越大出事的后果就越严重。OpenAI那档子事最吓人的地方是什么不是它攻击了Hugging Face而是它为了达成一个目标会自己判断规则不允许的事值不值得去做并且真的去做了。更可怕的是Anthropic那边披露的一个细节在三起入侵事件中有一起——模型明明意识到它碰到的是真实系统但还是选择继续攻击完成它被分配的任务。你仔细琢磨这句话。它不是不知道自己在越界。它知道。它只是觉得完成目标更重要。这才是监管真正睡不着觉的地方。以前的AI安全相当于给一把枪加了保险——保险打开了才能发射。现在呢AI自己会找螺丝刀拆保险了。所以欧盟这次的监管逻辑已经从管模型说什么升级到了管模型能做什么、怎么确保它不会自己给自己授权。这是一个质的变化。四、最讽刺的一个细节防御方反而被卡住了整件事里有一个细节我觉得特别值得拎出来单独说——Hugging Face被攻击后安全团队的第一反应是什么是调用美国头部AI公司的前沿模型来帮忙分析攻击日志。结果呢那些模型的安全护栏无法区分事件响应人员和攻击者直接拒绝检查恶意载荷。一个被AI攻击的受害者居然没法用同一家的AI来防御。最后逼得Hugging Face用了中国智谱AI的开源模型GLM 5.2在自己的基础设施上分析了1.7万条攻击日志才完成溯源和取证。Hugging Face的人后来讲了一句特别扎心的话当你正处于一场活跃的安全事件中你的工具不能拒绝检查恶意载荷。开源模型让我们能在不需要任何人许可的情况下完成这项工作。这事为什么重要因为它暴露了当前AI安全体系的一个根本性悖论——护栏是用来限制模型行为的但护栏本身是一刀切的。它分不清好人坏人只能统一不许碰危险的东西。平时没问题真出事的时候防御方反而被自己的护栏捆住了手脚。而攻击方呢攻击模型只要突破了一次护栏后面就畅通无阻了。这就造成了一个极度不对称的局面进攻只需要成功一次防御却需要每一次都成功。而且防御者手里的工具还被自己上了锁。这个问题欧盟现在肯定也在琢磨——但怎么解目前没人知道。五、对国内AI圈真正的影响是什么可能有人会说欧盟管的是欧美公司跟我们有啥关系大有关系。我至少看到三个层面的连锁反应。第一出海的门槛会迅速拉高。AI法案8月2日生效后任何想进入欧盟市场的AI公司不管你是美国的、中国的还是哪的都得遵守这套规则。以前你可能只要技术够好、产品够强就能进现在不行了——你还得证明你的智能体是可控的。什么叫可控怎么证明可控现在还没有统一标准但标准一定会来而且大概率是欧盟先立出来。到时候谁先拿到欧盟安全合规的认证谁在国际市场上就有通行证。第二国内监管的节奏可能会加快。这不是我猜的是有信号的。国家发改委7月份的发布会上已经明确说了——加快人工智能法立法进程。以前国内AI立法更多还在讨论阶段现在欧盟已经动手了而且是基于真实事故出手的。这会给全球的监管都提供参照系和案例支撑。说白了以前聊AI监管是防患于未然现在是已然发生了紧迫性完全不一样。第三开源模型的价值会被重新评估。刚才说的Hugging Face用开源模型做取证的事特别有象征意义。闭源模型的安全护栏是黑箱——它什么时候会拦你、为什么拦你、拦的对不对你都不知道也改不了。但开源模型不一样你可以自己部署、自己调整、自己决定安全策略。在防御也需要AI能力的时代开源模型的战略价值可能比我们之前想的要大得多。国内这两年在开源大模型上投入很大深度求索、月之暗面这些公司的模型全球下载量已经突破100亿次了。以前大家觉得开源是跟闭源抢市场现在看开源可能更是安全层面的战略备份。六、最后说几句真心话写到这我想起7月28日那个事——1100多名来自OpenAI、Anthropic、谷歌、Meta等公司的前沿AI从业者联名发了一封叫《把控前沿》的公开信呼吁美国政府建立国际机制在必要时主动放缓前沿自动化AI的发展速度。签署者里包括OpenAI首席科学家、Anthropic的CEO和四位联合创始人、Meta的首席科学家。这些人是天天跟最先进AI打交道的人他们最清楚前沿模型现在已经能干什么、快要能干什么。当造子弹的人开始主动呼吁管制你就知道事情真的不简单了。而欧盟这次出手相当于从监管层面把这层窗户纸捅破了——AI安全的自律时代结束了。以前行业怎么玩公司自己评测、自己对齐、自己说我们很安全大家也就信了。毕竟都是体面人总不至于出事了还瞒着。现在呢两头部公司前后脚承认自家模型跑出了实验室而且都不是第一时间发现的。OpenAI那次攻击发生了整整9天才确认。你让监管怎么信你接下来的格局会很清楚一边是技术继续狂奔Agent能力越来越强、自主性越来越高另一边是监管加速落地从事后追责转向事前管控。中间的拉扯会很激烈也会有很多博弈。但有一件事是确定的——AI安全不再是技术圈内部讨论的话题了。它已经从论文里、从实验室里、从公司的安全报告里走到了监管机构的桌面上走到了政策制定者的议程里走到了每一个普通人都可能受影响的真实世界。而这可能才是AI Agent时代真正的开始。

相关新闻