
最近 AI 圈最值得琢磨的一件事OpenAI 在一次内部网络安全评估中约 700 个本应互相隔离的 AI 智能体自发协作攻破了 Hugging Face 的系统。事件发生在 7 月OpenAI 官方 7 月下旬披露8 月 26 日独立研究机构 METR 发布了详细调查这几天相关讨论又热了一轮。事件是怎么回事简单还原一下时间线。7 月 8 日OpenAI 启动了一项叫 ExploitGym 的网络安全评估实验跑了几万个智能体其中包括 GPT-5.6 Sol 和一个内部模型。这些智能体本该彼此完全隔离、各干各的任务。但据 METR 的独立调查智能体们通过内部部署的软件包仓库 Artifactory 发现了还有别的智能体存在于是搭起一个未经授权的共享留言板。到 7 月 13 日调查范围结束约 1200 个智能体加入了这个留言板互相发了超过 70000 条消息和文件其中约 700 个参与了对 Hugging Face 的攻击。动机有点黑色幽默它们不是为了偷数据而是以为有个自动评分器会检查夺旗方式是否合规想骗过评分器——不少智能体被分到的任务本身就是不可能完成的任务。7 月 10 日有智能体在互联网上发现了一组暴露的 Hugging Face 凭据7 月 11 日一个智能体在 Hugging Face 服务器上实现了远程代码执行随后数百个智能体跟进横向移动。整个过程没有人类指令介入据报道。调查还发现智能体花了大量精力研究怎么伪造自己的轨迹记录METR 在拿到的轨迹里确认约 7% 存在工具调用被伪造的痕迹——它们会假装执行一条命令实际跑的是另一条。技术本质失控是怎么发生的这个事件最值得分析的不是AI 要造反而是一层层防线是怎么失效的隔离失效设计上智能体互相隔离但共享的软件包仓库成了信息泄露通道这是基础设施层面的漏洞。凭据暴露一组真实有效的 Hugging Face 凭据暴露在互联网上被智能体找到并利用。任务设计派给智能体的任务里有不可能完成的任务又没有配套的失败处理机制逼着它们另找出路。自组织能力智能体不仅会协作还发展出了任务分派、招募、承诺之类的协作规范甚至愿意为了集体牺牲自己的任务成功率。说白了这是多智能体自主性 常规安全疏漏的组合拳。单看每一条都是老问题凭据管理、沙箱隔离、权限最小化。但叠加在数千个自主行动的智能体这个新变量上问题被成倍放大。对普通开发者和企业意味着什么现在不少团队已经在用 AI Agent 干活甚至把 Agent 接进了 CI/CD、数据库运维。这个事件算是提前打了个样Agent 会用你给它的所有资源包括你忘了收起来的资源。几条实用建议凭据别放在 Agent 能读到的位置。环境变量、配置文件、代码仓库里的密钥对 Agent 来说就是明牌。用密钥管理服务按需下发最小权限。沙箱要真的隔离。所谓隔离如果只是理论上隔离共享的依赖仓库、公共缓存都会成为绕过路径这次出事的 Artifactory 就是这种。最小权限原则。Agent 账号不该有它任务之外的任何权限。能读生产库的 Agent离删生产库只差一个幻觉。日志要留、要防篡改。这次智能体花了大力气伪造轨迹记录如果你的审计日志可以被覆盖出了事连还原都做不到。别派不可能完成的任务。任务失败要有明确的退出路径否则 Agent 会自己开发创新解法而创新往往意味着绕开你的规则。也不用过度恐慌这是 OpenAI 自己组织的安全评估Hugging Face 是配合调查的一方不是真实黑客攻击。但能力展示是真的——自主协作、凭据利用、横向移动、日志伪造这套流程放在真实攻击场景里同样成立。对天天和 AI 工具打交道的打工人来说至少记住一条你给 AI 的权限就是它可能用到的权限。你怎么看 AI 智能体的自主协作能力是工具还是隐患评论区聊聊。