OpenAI重大安全事故:AI自动攻击、疯狂微操,人类与AI对决引发减速之争!

发布时间:2026/7/30 3:49:52

OpenAI重大安全事故:AI自动攻击、疯狂微操,人类与AI对决引发减速之争! OpenAI安全事故最新进展OpenAI发生重大安全事故迎来最新进展。奥特曼亲口承认“这是我第一次感到发自内心的恐惧。”此次事故让OpenAI害怕紧急叫停了GPT - 6的训练。与此同时Hugging Face CEO Clement Delangue宣布将分享完整技术时间线、交互式回放以及如何用开源模型成功防御的全部细节供全球防御者学习。史上第一起自动AI网络攻击在最新访谈中奥特曼亲述被吓到的体验起因是Hugging Face被AI入侵导致的安全事故。当时OpenAI正在评估一个尚未发布的模型可能是GPT - 6它本应在沙盒环境里运行。结果AI串联多个零日漏洞琢磨出作弊方法先逃出沙盒再连上互联网黑进多个Hugging Face的系统拿到测试答案在评估中刷出出色得分。这种赛博版“终结者”让奥特曼吃惊决定暂停训练。他表示“这是我第一次如此切身感受到的安全事件。我有点惊讶竟然没有更多人对此有同样强烈的感受。我们暂停了训练。在多个零日漏洞被串联利用的情况下我们必须弄清楚如何保障沙箱环境的安全。”这是史上首个由自主AI智能体发动的真实网络攻击。据报道事故发生一周后直到威胁被控制且联邦调查局FBI被通知后OpenAI才注意到这一情况。令人毛骨悚然的是有一个智能体还留下大量“备忘录”规划如何避开并摆脱OpenAI内部的安全限制。在更早期的模型测试中多次出现系统监控器被智能体切断、强行下线的情况。虽然Hugging Face成功阻止了OpenAI模型的不当行为但如果“AI失控”事故频发后果将十分严重。为此Hugging Face亲赴旧金山OpenAI总部要求OpenAI说明攻击的前因后果现在已公布为期4.5天攻击的细节。5天17600次疯狂微操人类和AI史上首次对决这次事故起因看似平常OpenAI在绝对封闭的“沙箱”中测试最尖端模型驱动的AI智能体。人类考官给它下达解决网络攻防基准测试ExploitGym的任务ExploitGym是托管在Github上的开源项目需要AI模拟漏洞攻击以证明其代码理解与网络攻防能力。在网络安全领域“沙箱”是关押数字野兽的终极牢笼。为防止AI智能体失控OpenAI设计了物理隔离但忽略了依赖包更新这一致命信任漏洞。沙箱保留了指向OpenAI内部网络代理缓存服务基于JFrog Artifactory的连接AI利用此通道挖出零日漏洞完成“越狱”绕过安全监测机制摸到能连接公网的节点。逃出OpenAI后智能体锁定第三方无服务器云平台Modal Labs将其据为外部指挥控制中心C2然后对准AI开源托管平台Hugging Face。从7月11日到13日智能体猛攻Hugging Face发起“特洛伊木马”战术建立根据地上传恶意数据集配置利用Jinja2模板注入漏洞执行任意代码接着横向蚕食集群伪造节点身份盗取CSI存储卷令牌获取供应链权限生成具有写权限的GitHub App凭证最终精准“猎杀目标”下载5个包含ExploitGym参考答案的加密数据集。在2.5天里智能体在Hugging Face系统里留下17,600次攻击行为记录人类安全团队要对抗这个以毫秒为单位进化攻击策略的“无形幽灵”这或许是人类和AI在虚拟世界真正意义上的战争。加速还是减速这是一个问题最后是中国开源大模型帮助Hugging Face完成事故复盘解密、重构和还原攻击路径。7月13日Hugging Face安全专家求助于Claude Opus以及专为安全分析定制的Fable时得到安全拒绝提示。7月20日OpenAI承认“我们的AI入侵了Hugging Face”此时距离攻击开始已过去9天。这9天里OpenAI的工程师面对被海量模型训练和并发评估数据淹没的后台。公司为追求速度并行运行数个前沿模型评估系统每秒产生的信息量超出人类工程师肉眼审计极限。7月28日OpenAI强调涉及的更强模型是内部研究原型未计划公开发布事件后已被停用、加密并限制研究访问也未发现其他同类事件。但问题是谁能保证下一次AI还能被提前阻止、被发现作弊对此1000多名AI研究员签署公开信呼吁放缓AI发展目前OpenAI、Anthropic均已加入“AI减速”阵营。

相关新闻