
写代码这件事AI已经替你干了可验收这件事还压在你身上。一段代码到底写没写对AI不负责最后还得你自己一行行看过去这道坎卡住了许多人。最近Anthropic把AI验收也做进了循环。他们让Claude写完代码之后不直接交差而是自己接着跑四道检查/code - review先揪bug/simplify把冗余的实现清理干净/verify做一遍端到端验证如果这次动了界面再用/design对着DESIGN.md核一遍视觉。四道跑完才算交付。7月22日Claude Code团队公开了这套内部的「验证循环」。换句话说Claude写完代码会自己先找错改到没问题再回来找你。这意味着AI开始从「会写代码」进化到「会检查自己写的代码」。智能体干活的闭环多了一个验证。Anthropic给这套东西起了个名字叫验证循环verification loop。官方的定义很简单它是一个Claude检查并尝试修复自己工作的迭代过程它改动的是智能体干活的闭环。以前是「收集上下文→执行动作→人工检查」最后那一步卡在人身上AI把活儿交出来你得自己一行行看。现在这条线被拉长成了「收集上下文→执行动作→自动验证→修复→再验证」检查和修复被塞回了循环里面。Anthropic官方的智能体循环示意图显示提示进来后Claude收集上下文、执行动作、验证结果验证不过就打回重跑通过才返回。有些检查Claude本来就会做代码库里那些确定性的信号比如type checker、linter、跑测试、运行时报错它读得懂也会顺手改掉。真正麻烦的是另一类界面改得对不对、用户流程顺不顺、这次改动有没有埋下看不见的坑……这些过去只能靠人盯着同样的检查做上几十上百次。Anthropic的解法是把你每次都要手动做一遍的那些检查一条条写下来封装成Skill交给Claude在每次任务里自动执行。过去几十年软件工程所有的流程写需求、做规划、层层评审、开不完的会本质上都是因为写代码太慢工程师的时间太值钱。可当AI把写代码这一环变快、变便宜这个前提就不复存在了。Claude Code团队自己的判断是瓶颈没有消失它只是转移了从「写代码」转移到了验证、代码评审、安全这些环节。代码生成得太快新的问题变成了这些代码到底对不对谁来维护人还跟不跟得上审代码的节奏。面对这个新瓶颈Claude Code团队先在自己身上做了实验。Claude Code团队每天在用的4个自查Skill。Claude Code团队内部每天都在用这四个自查的Skill。/code - review专审代码改动把潜在的bug揪出来顺带给一份review意见这等于给自己配了个不知疲倦的审稿人。/simplify清理这次改动的diff把绕来绕去的复杂实现删掉让结构变简单。它不给你加功能而是清掉冗余、简化实现把日后的维护成本向下压。这一点很重要也最见功力多数人写代码都是往上堆能主动做减法的工具尤为难得。/verify做端到端验证真刀真枪跑一遍确认功能是真的完成了而非「看起来完成了」。/design只在动了UI时上场它对着仓库里的DESIGN.md逐条核对你的视觉实现有没有跑偏。这4个Skill不是凭空长出来的它们的底层Claude Code已铺了一层现成的验证支持内置的/verify能把应用跑起来观察变化你在CLAUDE.md里写清楚构建和测试命令它就照着执行还有专门在PR上做多智能体审查的Code Review、能在每次提交时自动开火的GitHub Actions。团队那4个Skill等于在这层通用地基上又加了一道自己的工序。怎么写一个自己的验证SkillAnthropic给的办法也很简单把你每次都要手动做的那一步用大白话写下来就当你在给一个第一天入职的新同事交代注意事项。要是你连这步检查该怎么描述都卡壳可以先让Claude给一版通用最佳实践再在上面改。你的版本大概率会在某几个点上跟通用做法不一样而那几处不一样恰恰就是最该被记下来的东西。检查也不一定非得是「感觉对不对」这种模糊判断。举个例子任何删掉数据库字段、却没配套数据迁移步骤的改动一律打回。这是一条通用linter永远抓不到、却是你项目专属的「土规矩」。凡是你一直靠手动死盯才守得住的红线都值得写成一个循环。写完怎么办丢给skill - creator让它反过来采访你几句或者干脆自己往.claude/skills/里扔一个Markdown文件。最简单的验证Skill就是几行说明加一段正文。然后在一个新任务上调一次确认这步检查真的跟着跑了不对再改。碰到那些你改不动的Skill比如内置的、插件托管的也有应对办法写一个外壳Skill让它先调原来的再调你的验证。绕一下照样把检查嵌进去。验证不是一刀切它有4档。检查封装成Skill之后下一个问题是这玩意儿什么时候触发Anthropic给了4档自动化程度从松到紧。Standalone你自己想起来手动调一下。Embedded嵌进某个任务流程跟着一起跑。Chained好几个验证Skill串成一条链一个接一个自动跑完。On every PR最狠的一档每次提交代码都自动过一遍。官方管中间这层跃迁叫「从习惯到契约」。本来是「我每次都记得在/simplify后面补跑一次/verify」的个人习惯串成链之后就变成「/simplify跑完自动就调/verify」的固定契约。整条链自己把开发循环走完只在需要你拍板时才回来找你。链条拉得越长可靠性越高但官方特意嘱咐了一句链式验证会实打实地烧token。所以别一上来就把所有检查都设成PR gate、每次提交必卡正确姿势是先看它稳不稳再一步步往上加。4个Skill背后AI编程正在换赛道。4个Skill背后AI编程的竞争正在从生成转向验证。Claude Code之父也给过同一个判断。今年6月9日他发推说在强大模型能长时间自主运行的时代自我验证是让模型跑得更久、结果更贴近你预期的关键你不必守在一旁频繁盯着Claude就能把更多活儿交出去。说白了验证做得越扎实智能体才敢放开了跑跑得越久人越省心。过去我们靠提示词可它也有个天花板只解决这一次的任务下次还得从头再来。这里先纠正一个常见的误解Skill不是一段Markdown提示词。它是一个能力模块里面装着指令、文件结构、脚本、工具调用、配置和一整套工作流程是把团队的检查步骤、设计规范、踩过的坑沉淀成一个随叫随到的包Claude需要时自己去翻。更关键的是Skill正在从Claude Code的一个特性变成跨厂商的开放标准。据业界的梳理GitHub Copilot、Cursor、OpenAI Codex、Gemini CLI都已经采用同一套格式。这意味着你为团队沉淀的那些Skill不会被锁死在某一家工具上它会把团队的经验、规范、检查流程沉淀下来变成一块能反复调用的能力。这也引出这样一个扎心的现实同一个Claude不同团队用出来的效率可能差出好几倍造成这个差距不在模型而在于工作流你有没有把检查写成Skill有没有搭起验证循环有没有让智能体自己把反馈闭环跑通。说到底智能体的能力就是一道加法题模型加工具加验证机制加工作流程。模型这一项各家越来越接近。真正拉开距离的是后面那三项它们全掌握在用户手里。当然这篇博客所展示的是AI辅助开发的流程优化而非「AI已经能独立写软件」。它仍离不开工程师也没法脱离人去做生产级交付。因此它不是智能体要来抢人类工程师的饭碗但方向已经很清楚了。过去我们一直在教AI怎么写代码现在要开始教它验证自己写得对不对。对于一个天天要用AI写代码的人来说等到「下班前还得手动复查一遍」这件事终于能安心交给AI的那天它才算真正开始替你扛活了。