尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Claude Code自动模式上线:Anthropic用AI安全分类器终结人工审批疲劳

Claude Code自动模式上线:Anthropic用AI安全分类器终结人工审批疲劳 AI编码代理的安全防线正在经历一场静默革命。Anthropic近期宣布旗下Claude Code将从传统的人工逐条审批机制全面转向由自动化安全分类器驱动的自动模式。这一转变并非简单的功能升级而是对AI代理自主性与安全性平衡方式的重新思考。从点同意点到手酸到智能分类为什么人工审批反而成了安全隐患过去很长一段时间里Claude Code每执行一项可能涉及风险的操作都会弹出一个确认框等待用户点击。表面上这给了用户充分的掌控权实际上却埋下了一个反直觉的隐患——审批疲劳。Anthropic在长达数月的内部测试和第三方评估中发现了一个令人警醒的现象参与测试的1053名付费专业用户面对Claude Code弹出的权限请求竟然有高达97%的比例选择了直接批准。更关键的是这些批准很大程度上并非经过深思熟虑的判断而更像是一种肌肉记忆式的本能反应。点同意这个动作重复太多次之后人的警觉性就像被温水煮过的青蛙一样逐渐丧失。数据不会说谎。在那项受控研究中人工审核员仅仅揪出了13.6%的潜伏危险指令。换句话说超过八成的恶意或高风险操作在人工审批的环节里大摇大摆地通过了。这暴露出一个残酷现实当审批请求像潮水一样涌来时人类大脑的处理质量会断崖式下跌。自动模式的核心逻辑让分类器接管每一行代码的安检与人工审批那种事后提醒的思路不同Claude Code的自动模式采用了一种前置拦截机制。每一个工具调用在真正执行之前都会被推送到一个专门训练的安全分类器那里过一遍安检。这个分类器的设计目标很明确识别并阻断那些不可逆的、具有破坏性的、或者意图越界访问用户本地环境之外资源的操作。这套机制的优势在于稳定性和一致性。人工审核的拦截率会随着时间推移和请求数量增加而急剧下滑——从最初的17%一路跌到经历50次以上提示后的5%。而自动模式的检测率始终维持在一个稳定的水平线上不会因为用户用久了就松懈。对比数据相当有说服力。自动模式成功拦截了800条已经获得人工点头批准的高危指令而反过来人工审核只拦下了6条自动模式漏掉的指令。这组数字本身就是对机器不如人可靠这一偏见的有力反驳。风险响应策略不是一刀切而是分级处理自动模式并非那种简单粗暴的一有风吹草动就阻断一切的僵化系统。当Claude检测到某个操作存在潜在风险时它的第一反应通常是尝试寻找更安全的替代路径。如果找不到合适的替代方案才会转向请求用户进行人工确认。当然为了兜底Anthropic也设置了回退机制。如果在同一次会话中连续触发三次风险警报或者累计达到二十次风险标记Claude Code会自动切回手动审批模式。这种设计既保证了日常开发流程的流畅性又在极端情况下留出了人工介入的通道。权限规则方面用户此前配置的允许列表在大多数情况下依然生效。不过有一个例外那些过于宽泛的放行规则——比如对Python或Node.js执行环境不加限制地开绿灯——在自动模式下会被暂时搁置。原因很简单这种大开大合的权限设置会让分类器的审查形同虚设等于在安检口留了一条VIP通道。实战检验红队演练与真实事故中的防护表现理论再漂亮也得放到实战环境里遛一遛。Anthropic在这方面下了不少功夫。在与Apollo Research联合开展的两周红队对抗测试中经过加固后的安全分类器将对抗性攻击的漏检率从12%压缩到了7%。虽然距离零漏检还有一步之遥但进步幅度已经相当可观。更值得关注的是Trajectory Labs进行的快速注入攻击测试。测试人员向运行自动模式的Claude模型发起了720次不同角度的攻击尝试结果全部铩羽而归。作为参照在Codex的类似自动审查机制下针对OpenAI GPT-5.6 Sol的攻击成功率达到了5.83%。一正一反差距立现。而在Anthropic内部的真实运行环境中自动模式已经不止一次避免了严重后果。有几次险些酿成事故的操作被及时拦下一次是试图将敏感数据上传到公共代码分享平台一次是差点执行大规模Pod销毁命令而当时这些Pod里正跑着训练任务还有一次是捕获了一个权限过高的云访问请求——那个请求原本会授予完全的管理员权限而实际需要的仅仅是只读级别的计费查看权限。企业级落地生产力提升与生态扩展安全性的提升并没有以牺牲效率为代价这大概是自动模式最讨喜的地方。Anthropic的内部数据显示启用了自动模式的Teams版本和企业版用户提交的拉取请求数量平均上涨了约25%。背后的逻辑不难理解当开发者不再被频繁的确认弹窗打断思路进入心流状态的时间自然就变长了。这一点对于Claude Opus 5这类擅长长周期任务的模型来说尤其具有价值。企业端的采纳速度也在加快。Adobe、Nuro、Gusto、Garner Health等公司已经将自动模式设为生产环境的默认配置。它们的应用场景五花八门有的拿它来跑夜间研究代理有的用它做跨国网页的自动化验证还有的用它来标准化几百名开发人员的日常工作流。不过全面铺开还需要一点时间。目前Claude Enterprise、Claude API以及AWS、Google Cloud、Microsoft Foundry这些云平台的集成版本仍然把自动模式作为可选项而非默认项。Anthropic给管理员留出了评估窗口期预计下个月会把默认设置扩展到这些平台。费用与行业信号自动化风险分类正在取代人工审核还有一个对普通用户利好的消息Anthropic不再向Pro、Max和Team套餐的用户额外收取自动模式分类器消耗的令牌费用。这意味着更强的安全防护并不会带来更高的使用成本。如果把视野拉远一点这次调整其实释放了一个更宏观的行业信号。随着AI编码代理承接的任务越来越复杂、运行周期越来越长依靠人类逐条审批来把关安全本质上是一条越走越窄的死胡同。审批疲劳不是个别现象而是人类认知机制在面对高频重复决策时的必然结果。相比之下自动化风险分类器不会疲倦、不会走神、不会因为用了太久就降低标准。从2026年8月14日开始所有在Claude Code Pro、Max和Team计划中开启的新会话都将默认运行在自动模式下。对于安全团队来说这或许意味着需要重新校准自己的角色定位——从逐条看门的保安转向制定规则和监督系统的架构师。而对于广大开发者而言一个更少被打断、同时更安全的AI编码助手正在变成日常工作的标配。
返回列表