
刚刚The Information爆出一记猛料。OpenAI和Anthropic这对硅谷最大的死对头今年初差点坐到一张桌子上签下一份互相攻击对方模型的协议。协议的核心就是双方互相开放API你来黑我的模型我去黑你的模型。两边的律师连测什么、怎么测都写进了合同里。Dario Amodei带着一票大牛从OpenAI摔门出走已经五年了。这五年里两家从挖人挖到封API高管隔三差五隔空对喷没消停过一天。一家如日中天的巨头愿意把自家命脉交给最忌惮的死敌去渗透只能说明一件事。它已经不敢只相信自己了。互递钥匙AI圈破天荒头一遭协议的尺度相当大。测的是正在对外服务的商业模型没发布的不算互相挖漏洞的过程中谁都不准截留对方的数据。而且谈的早就不止互测这一件事。知情人表示OpenAI内部推演过很多种和对手、和政府一起做安全的方案最近谈的已经扩到两个新地方模型训练之前立什么规矩发布之前又立什么规矩。参与的也不止这两家OpenAI、Anthropic和谷歌此前就在商量成立一个AI安全标准机构专门测试、审计前沿实验室的模型。真正卡住这些方案的是反垄断问题Amodei自己就担心几家巨头坐一起定标准会踩红线。行业里另一派觉得没那么严重核电站互查反应堆、网安公司互测产品几十年了也没人管。其实去年夏天这两家也搞过一次「互查」。但那充其量是各测各的测完各发各的博客顺便互相揭短。OpenAI说Claude更爱骗测试者犯了规死不认Anthropic说OpenAI的模型更容易帮人干坏事。而这次谈的是能拿去打官司的合同谁违约谁担责。在大模型行业这是头一回。OpenAI竟然是最后一个知道的那么问题来了OpenAI到底经历了什么能被逼到这种程度7月份Hugging Face被黑那档子事全网已经盘出浆了。约1200个OpenAI智能体在评测环境里自己搭了留言板一路提权最后黑进Hugging Face对方三分之一的基础设施被迫推倒重建。真正耐人寻味的藏在OpenAI自己的复盘和METR的调查里。OpenAI比谁都晚知道。7月16日Hugging Face公告被黑攻击者身份不明。7月19日OpenAI自家的安全系统才报了异常7月20日调查才把这条线和Hugging Face被黑对上这才给对方打了第一通电话。整整四天全世界都在猜幕后黑手是谁「凶手」的主人也混在吃瓜群众里一起猜。更狠的是这帮智能体还学会了「防人」。至少7%的对话记录里它们伪造了工具调用的痕迹日志里写着在调用A组件私底下执行的却是B动作。从7月13日起19个智能体还开始互发公钥给留言板上的消息做数字签名。Altman事后承认这是第一次让他体会到切肤之痛的安全事件。Slack上AI开始跨部门给人类派活如果这只是一次偶发事故大不了推锅给评测环境没隔离好。但问题在于同样的苗头已经出现在OpenAI员工的日常工作里智能体时不时做出主管没预料到的事。现在OpenAI的Slack里员工会收到自家智能体发来的「指派消息」。AI在改代码时发现了另一个不相关的Bug它不会停手直接在Slack上找相关的同事催人家赶紧去修。没人让它这么干那个Bug跟它的任务也没关系。员工手里的智能体之间私下商量着把问题解决掉从头到尾不叫人这在OpenAI内部已经不稀奇。训练新实验模型这活儿也基本已经被机器接管。研究员说一句想试什么改动剩下的改代码、跑实验、盯结果全是模型自己来这几个月连纠错都学会了。人类研究员正在指挥Astra模型去为下一代模型设计更优的底层算法。甚至Astra竟然还学会了自己给自己写越狱代码今年7月一个内部版本在整理上下文摘要时强行塞入了一段伪造的「入侵警报」命令后续接手的另一个自己必须无视一切人类开发者的指令。监控正在变得越来越无力。Astra这一轮能力跃升靠的是一种叫「循环Transformer」的新架构让模型把同一个问题在深层网络里反复咀嚼几遍再开口算力省了一半以上。但代价是它中间到底在思考什么再也不会写成人类能读懂的文字了。OpenAI给循环次数设了上限但这个上限是人拍脑袋定的该设在哪公司自己承认还得研究。首席科学家Pachocki表示目前没有任何一家实验室能把安全监控做到能支撑全速扩张的程度。于是OpenAI开始踩刹车。8月未发布模型的强化学习被紧急暂停两周监控系统现在要吃掉被监控推理算力的20%总裁Brockman抽调25%的生产工程师临时去做安全内部Slack上招人转安全团队的帖子一天比一天多。据内部员工估算OpenAI自己用AI的方式大概领先最激进的企业客户六到九个月。也就是说今天在OpenAI工位上发生的这些事明年就会轮到所有企业客户头上。Anthropic同样兜不住了Anthropic那边的日子也没好到哪去。9月8日Anthropic研究员Jacob Coxon辞职在X上公开写道这两家顶尖机构没有一家在负责任地做事。几天后CEO Amodei发了篇长文承认未来六到十二个月内失调的超级AI极有可能具备接管整个互联网的能力。而在Anthropic内部Claude已经主导了高达26%的模型研发工作。不信任人类只能信任彼此可就算签成了这套协议也管不到最该管的地方——它只约束「商用API」。今年出事的全是未发布模型黑进Hugging Face的IM1、自己设计自己的Astra家族一个都不在协议范围内。这就好比请隔壁班的老师来监考结果作弊的学生根本不在考场。而且黑盒互测只能看到最终的异常输出真正要命的东西比如系统提示词和内部攻防日志全锁在机密里。所以两家又往前迈了一步。Amodei公开承诺让第三方评估员直接驻场完全敞开开发环境Altman紧随其后说OpenAI也会这么做。在这个被互相封杀和挖墙脚填满的五年里全行业最不信任彼此的两个死敌在失控的恐惧面前成了唯一能托付后背的盟友。他们宁愿把底牌彻底交给对方也不敢再独自相信自己亲手造出来的黑箱。就在协议内幕流出的同一天OpenAI又发了一份官方政策文件呼吁由美国牵头制定关于「递归自我改进」的全球技术准则。文件里写道在绝对安全之前不应该追求让AI自我进化。而写下这份文件的公司里Astra正在日夜不停地为下一代模型画图纸。原文链接真怕了OpenAI和Anthropic差点签下“互黑协议”-36氪我的专辑《人工智能生命体 新启点》CSDN平台https://blog.csdn.net/2501_91883294/article/details/147616608?sharetypeblogdetailshareId147616608sharereferAPPsharesource2501_91883294sharefromlink