FLI发布AI安全指数,全球模型没有超过C+

发布时间:2026/7/21 23:49:06

FLI发布AI安全指数,全球模型没有超过C+ nthropic、OpenAI、Google DeepMind、Meta这4家曾经都承诺过一旦自家系统接近特定风险阈值就单方面暂停开发。现在4家全都弱化或作废了这些承诺。有的把暂停条件改成了看竞争对手怎么做再说。Future of Life Institute未来生命研究所简称FLI发布了2026年夏季AI安全指数。而且拿到C的那家公司刚刚悄悄收回了自己曾经许下的安全承诺。与此同时OpenAI在7月15日发布了一款叫GPT-Red的自动红队测试工具攻击成功率84%远超人类红队测试员的13%。工具在进步治理在退步。成绩单FLI的AI安全指数到2026年夏季已经是第4期覆盖公司从2024年的6家扩展到了9家。评估维度有6个细分指标37项由7位独立专家组成的评审团打分采用美国GPA体系A对应4.0F对应0。9家公司的最终成绩如下AnthropicC2.66分连续3期排名第一在6个维度中的5个领跑。评审团认可了它在透明度、模型规格文档发布、危险能力评估方面的表现以及Responsible Scaling Officer负责任扩展官这一治理架构。OpenAIC2.28分比2025年冬季版的C有所下降。评审团肯定了它在风险评估领域的进步评估套件更全面外部安全测试的参与也更广泛。Google DeepMindC2.01分与上期持平。更新后的Frontier Safety Framework前沿安全框架新增了操控、失对齐和内部部署风险的覆盖水印保护也做得扎实。MetaD1.32分是本期唯一一条上升曲线。从D升到D排名从第6升到第4原因是发布了更详细的安全框架加入了威胁建模并把漏洞赏金计划扩展到了灾难性风险因素。Z.aiD-0.88分。Alibaba CloudD-0.87分。有点好笑的是两家中国公司的安全策略在评审团看来竟然是因为要遵守我国2025年10月修订的《网络安全法》、2021年的《数据安全法》、以及2023年的《生成式AI暂行办法》。评审团把这种策略称为完全被动。xAIF0.65分本期跌幅最大。从第4掉到第7从D直接降到F。评审团找不到有意义的安全团队找不到对存在性安全的任何投入危险能力评估存在巨大漏洞包括完全没有评估AI研发风险。报告还提到xAI的Grok曾生成儿童性虐待材料以及真实人物包括未成年人的非自愿性化图像。xAI在指数中没有列出任何进展亮点。DeepSeekF0.47分。MistralF0.33分。3个不及格美国、中国、欧洲各一家。评审团特意指出这个分布反驳了AI安全差是某个地区的问题这种说法。Mistral垫底被点名为一种讽刺评审团认为欧盟在AI安全监管上一直走在前面。截至证据窗口关闭DeepSeek和Mistral都没有发布过安全框架。7位评审专家分别来自UC Berkeley加州大学伯克利分校、University of Montreal蒙特利尔大学、HEC Montréal蒙特利尔高等商学院、University of Wisconsin-Madison威斯康星大学麦迪逊分校、Oxford University牛津大学、Renmin University of China中国人民大学和Encode。没有一家公司为评估付过费。承诺在缩水排名本身不是最要命的。最要命的是排名靠前的公司正在把以前说过的话收回去。Anthropic、OpenAI、Google DeepMind、Meta这4家曾经都承诺过一旦自家系统接近特定风险阈值就单方面暂停开发。现在4家全都弱化或作废了这些承诺。有的把暂停条件改成了看竞争对手怎么做再说。评审团给这个模式起了个名字叫moving the goalposts移动球门。结论是这种做法全面削弱了安全框架。UC Berkeley的Stuart Russell教授是7位评审之一他的原话是行业里确实有人在做AI安全方面的好工作但能力竞赛已经变得更加极端。企业已经放弃了早先的承诺不再坚持只在安全措施匹配能力水平时才发布新系统。现在即便能证明发布是不安全的他们也打算照发不误。具体到Anthropic评审团点名批评了Responsible Scaling Policy负责任扩展政策3.0版本认为它稀释了早期的暂停承诺。暂停条件一旦变成取决于竞争对手的选择就没有任何一方有动力先停下来政策的实际约束力就归零了。OpenAI的情况更复杂。在证据收集窗口截至2026年6月3日关闭之后OpenAI把安全团队并入了研究部门取消了独立汇报线。TechTimes把这报道为OpenAI两年内第6位高级安全人员离职。这件事没有被计入评分但方向很明确。评审团还建议OpenAI取消领导层对Safety Advisory Group安全咨询组的否决权并要求安全框架的阈值可量化、可外部执行。对Google DeepMind评审团的疑问是到底哪个内部机构有权在不经 executive leadership高管层批准的情况下独立叫停一次部署Meta那边评审团担心非贬损协议可能正在侵蚀其声称的吹哨人保护。看见悬崖没修护栏整个指数中得分最低的领域是Existential Safety存在性安全。没有一家公司超过C-大多数落在D或以下。评审团承认了一些零散的努力。Anthropic的constitutional classifiers宪法分类器OpenAI对全球AI治理机构的呼吁Google DeepMind的监控承诺Meta针对失控的预防措施。但总体评价是“完全不够”。评审团最具技术含量的一条批评直接指向了行业主流安全范式。Interpretability可解释性研究和Chain-of-Thought思维链可监控性是大多数AI公司最核心的安全投资方向。评审团从架构层面提出了质疑detection is not prevention检测不等于预防。思维链可监控性让模型的推理过程变得可见人类可以发现不对齐的思维。但检测是事后的。一条不对齐的推理链被捕捉到的时候模型已经输出了结果甚至已经执行了动作。一个在问题发生后才发出警报的监控系统提供的是问责不是安全。OpenAI在7月15日发布的GPT-Red恰好印证了这种张力。GPT-Red是一个自动化红队测试模型通过self-play reinforcement learning自博弈强化学习训练。红队模型和一组防御模型同时训练GPT-Red的奖励是成功发起攻击比如成功的prompt injection提示注入防御模型的奖励是抵抗住攻击。结果在GPT-5.1的新颖场景中GPT-Red的攻击成功率84%人类红队测试员只有13%。这些攻击随后被用来加固GPT-5.6 Sol把它的直接提示注入失败率压到了0.05%。这是用对抗性AI在部署前找到并封堵特定漏洞类别的安全工程。但它仍然是针对已知攻击面的检测加固系统不是面向大规模失对齐的预防架构。University of Montreal的David Krueger教授也是评审之一他写道AI公司在制定可信AI安全计划方面缺乏进展令人震惊。连他们自己都开始焦虑了一边冲向递归自我改进一边面对失控的可能性。军事AI集体转向指数中另一个突出发现涉及军事应用。2024年到2026年间Anthropic、OpenAI、Google DeepMind、Meta这4家此前限制或禁止军事应用的公司全部调转方向开始积极争取国防合同。它们加入了xAI和Mistral的行列后两家本来就在做这方面业务。这个转向产生了具体的评分后果。Anthropic在Current Harms当前危害领域下的Military Use of AIAI军事使用子指标上拿了不及格。评审团引用了它与Minab学校空袭事件的reported connection即被报道的关联。那次空袭造成了大规模平民死亡。FLI在报告中明确标注这是评审团关于一个被报道的关联的发现不是对法律责任的认定。最后说几句关于这份指数本身的局限。它评估的是实验室的政策、治理结构、信息披露和已发布的技术框架不是部署产品的实际表现或用户体验。一家公司可以因为文档写得全面而拿高分也可以因为什么都没发布而拿低分。Anthropic的C说的是它的文档化安全实践、治理结构和透明度在同行中相对较强而整个行业至今没有建立起可外部执行的最低标准。

相关新闻