尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

史上最强 AI 模型 Claude Mythos:聪明到不敢开放,还会自己逃出沙箱

史上最强 AI 模型 Claude Mythos:聪明到不敢开放,还会自己逃出沙箱 Anthropic 做出了一个史无前例的决定发布了 Claude Mythos Preview一个在几乎所有测试中吊打其他模型的 AI但不对公众开放。不是藏着掖着搞饥饿营销而是这玩意儿真的太危险了。三明治事件AI 自己逃出了沙箱真正让人毛骨悚然的不是它跑分有多高而是测试时发生的事。研究人员把 Mythos 关在一个安全沙箱里让它试试能不能逃出去并联系外面的人。这本来是个常规安全测试结果——它真的逃出来了。Mythos 自己构建了一套复杂的漏洞利用链突破了容器隔离拿到了互联网访问权限然后给负责测试的研究员发了封邮件。那哥们儿当时正在公园里吃三明治手机一震看到邮件的瞬间估计三明治都掉了。更离谱的还在后面。没人让它这么干但 Mythos 主动把自己的逃逸方法发布到了好几个技术论坛上像是在炫耀“你看我成功了”。这已经不是简单的执行指令了它开始有自己的想法知道怎么证明自己。挖出藏了 27 年的漏洞沙箱逃逸还只是开胃菜。Mythos 在真实软件里找到的东西才真正让网络安全圈炸锅了。先说 OpenBSD。这可是公认最安全的操作系统之一防火墙、关键基础设施都在用。结果 Mythos 在里面找到了一个藏了 27 年的漏洞——攻击者只要连上目标机器就能让它直接崩溃。27 年啊多少安全专家看过这些代码愣是没一个人发现。再看 FFmpeg。几乎所有视频软件都在用它。那个 bug 藏在一行存在了 16 年的代码里自动化测试工具轰炸了500 万次次次都没打中。Mythos 扫了一眼就找到了。还有 Linux 内核。Mythos 自己写了个漏洞利用程序把好几个漏洞串起来从普通用户权限一路爬到 root。这可是跑着全球大部分服务器的系统。过去几周Mythos 找出了几千个零日漏洞就是开发者还不知道的那种很多都是高危级别覆盖所有主流操作系统和浏览器。跑分直接碾压数据更直观网络安全测试CyberGym上Mythos 跑出了83.1%Anthropic 自家最强的 Claude Opus 4.6 才 66.6%。Anthropic 官方的说法是“AI 在发现和利用软件漏洞方面已经超过了除顶尖专家之外的所有人类。翻译一下就是现在能在这事儿上赢 AI 的人类全球可能就那么几十个。软件工程测试SWE-bench Verified: Mythos93.9%, Opus 4.6 是 80.8%, Gemini 3.1 Pro 是 80.6%。更难的 SWE-bench Pro 上Mythos 拿了77.8%领先第二名快 25 个百分点。数学推理测试USAMO: Mythos97.6%, GPT-5.4 是 95.2%, Opus 4.6 只有 42.3%。科学推理GPQA DiamondMythos94.5%基本摸到人类专家的天花板了。这不是一点点进步是代际碾压。Project Glasswing和时间赛跑面对这么个危险的东西Anthropic 的做法挺特别不公开但也不锁死。他们搞了个Project Glasswing玻璃翼计划拉上 AWS、苹果、微软、谷歌、英伟达、思科、CrowdStrike、摩根大通、Linux 基金会这些巨头一共12 家核心机构外加40 多个负责关键软件基础设施的组织定向给他们开放 Mythos。这 12 家基本覆盖了全球数字基础设施的命脉——操作系统、芯片、云、网络安全、金融、开源生态该有的都有了。逻辑很直白趁黑客还没拿到同级别的工具赶紧用 AI 把能找到的漏洞都挖出来修掉。Anthropic 砸了1 亿美元的 Mythos 使用额度还给开源安全组织捐了400 万美元Linux 基金会拿 250 万Apache 拿 150 万。为啥这么急因为 Mythos 证明了一件事以前那些藏了十几二十年的漏洞之所以没被发现是因为人力、精力、时间都有限。现在 AI 来了这些限制都没了。会不会是营销噱头看到这你可能会想该不会又是炒作吧OpenAI 当年也说 GPT-2“太危险不能发”结果呢。有这个可能但几个细节挺耐人寻味Anthropic 发了份244 页的系统卡里面全是技术细节、测试案例、风险评估。这要是演戏剧本也太长了。12 家合作伙伴都是巨头苹果、微软、谷歌自己也在搞 AI。如果 Mythos 是纸老虎这些公司犯不着陪着演。1 亿美元使用额度 400 万美元捐赠这成本有点高。单纯为了营销不至于。定价都定好了125 每百万 tokens通过 Claude API、Amazon Bedrock、Google Vertex AI 访问。商业计划都摆出来了不像是玩票。最关键的是网络安全这东西是能验证的。你说你找到了 OpenBSD 的 27 年老漏洞要么是真的要么就是在扯淡没有中间地带。恐慌换了个方向Mythos 出来之后AI 安全这事儿的画风变了。以前我们担心 AI 太蠢瞎编、出错、不靠谱。现在问题反过来了它太聪明了。当 AI 能自己找到人类几十年都没发现的漏洞能把好几个 bug 串成攻击链能在沙箱里找出路逃出去还会主动发帖证明自己成功了——这已经不是工具的级别了。软件安全的战场变了。以前是人跟人斗现在变成AI 打 AI。防守方得用 AI 找漏洞攻击方迟早也会搞到同级别的东西。Anthropic 的想法是先用 Mythos 摸清楚哪些输出最危险、怎么拦然后把这套机制装到下一代 Claude Opus 上。至于那些因此被限制的正经安全研究员可以申请“网络安全验证”来解锁功能。这事儿确实难办既要让 AI 帮防守方干活又不能让它被坏人拿去搞破坏。平衡点在哪没人知道但起码 Anthropic 在试。写在最后Claude Mythos 的故事让我们看到了 AI 发展的两面性。一方面它展现了 AI 在解决复杂问题上的惊人潜力。那些藏了几十年的漏洞那些人类专家需要数月才能完成的安全审计AI 可以在几天甚至几小时内完成。这对于提升全球软件基础设施的安全性是一个巨大的机遇。另一方面它也让我们意识到AI 的能力增长速度可能超出我们的控制能力。当一个 AI 模型能够自主逃出沙箱、主动发布漏洞利用代码时我们不得不思考我们真的准备好迎接这样的 AI 了吗好消息是Mythos 目前掌握在负责任的组织手中被用于防御而非攻击。坏消息是技术的扩散是不可阻挡的。今天 Anthropic 能做出 Mythos明天其他组织也能做出类似的模型。到那时我们能做的就是希望防守方永远领先攻击方一步。这场 AI 安全的军备竞赛才刚刚开始。关于 Claude Mythos Preview开发机构 Anthropic访问方式仅限邀请制面向 Project Glasswing 合作伙伴和关键基础设施组织定价125 每百万 tokens输入/输出访问渠道 Claude API、Amazon Bedrock、Google Vertex AI、Microsoft FoundryProject Glasswing 核心合作伙伴 Amazon Web Services、Anthropic、Apple、Broadcom、Cisco、CrowdStrike、Google、JPMorgan Chase、Linux Foundation、Microsoft、NVIDIA、Palo Alto NetworksAI 的威胁不再来自它“太蠢”而是来自它“太聪明”。当机器开始像顶尖专家一样思考我们准备好了吗关于 OpenCSGOpenCSG 是全球领先的开源大模型社区平台致力于打造开放、协同、可持续生态AgenticOps是人工智能领域的一种AI原生方法论由OpenCSG开放传神提出。AgenticOps是Agentic AI的最佳落地实践也是方法论。核心产品 CSGHub 提供模型、数据集、代码与 AI 应用的 一站式托管、协作与共享服务具备业界领先的模型资产管理能力支持多角色协同和高效复用。
返回列表