同样用 AI 写代码,为什么有人一次推进 12 步,你只能推 5 步?

发布时间:2026/8/2 6:00:15

同样用 AI 写代码,为什么有人一次推进 12 步,你只能推 5 步? 你是不是也踩过这些坑工具换了三轮提示词模板抄了满屏任务一复杂还是半途而废同事说「让 AI 全自动就行」结果 PR 里一堆似是而非的实现你连验收标准都说不清非研发同学开始用 AI 写脚本团队却仍按「谁会敲代码」分配任务真正懂业务的人反而被晾在一边出了 bug 只会「再生成一次」从不会把失败信号变成下一轮约束一组对约40 万次交互式 agentic coding 会话约23.5 万人2025-10 至 2026-04的隐私保护分析给出了很工程化的信号典型会话里人做约70%的规划决策做什么、选哪条路、怎样算完成模型做约80%的执行决策改哪些文件、写什么代码、跑什么命令用户在该任务上的领域专长度越高同一条指令触发的模型工作量越大新手量级约5 次动作 / 600 词输出专家量级约12 次动作 / 3200 词输出可验证成功commit / 测试通过 / 用户明确确认等硬信号新手约15%中级及以上约28–33%至少部分成功新手约77%中级及以上约91–92%收益主要发生在新手 → 中级中级与专家差距不大——够用的领域把握往往就够吃到大部分红利七个月内修 bug 类会话占比从约 33% 降到约 19%运维/数据分析/文档等「围着代码转」的工作在涨会话的估算任务价值平均约25%27%在产出代码的会话里非软件职业与软件职业的成功率往往只差几个百分点十大职业组多落在软件组 ±7 个点内下面不写论文复述只写你怎么改分工、改验收、改提示与门禁让 AI 真正放大「懂问题的人」而不是放大「会粘贴提示词的人」。先换问题框架缺的不是更强模型是可验收的规划权你现在常做的它假装解决了什么它其实没解决换更大模型 / 更贵套餐能力上限你是否说清「完成标准」堆提示词模板输出格式领域约束、边界案例「全自动 agent」宣传人手成本规划权是否被悄悄让渡只看最终 diff 行数忙碌感是否 commit、是否过测、是否可回滚数据里的分工很清楚人定 what模型定 how。你若在 what 层含糊how 层再勤快也是在高速做错的方向上挖坑。问题 1为什么「提示词工程」救不了复杂任务现象同一仓库、同一工具A一句话「帮我改登录」→ 模型改完一半就停或改到无关模块B写清目标用户、失败码、兼容旧 token、必须过的测试 → 模型能连着读文件、改实现、跑测根因会话里的「专长」不是职位而是任务专属信号指令是否带领域精度规则、接口契约、业务不变量你要求模型验证什么测试、日志、对照表纠错方向是你在纠正模型还是模型在纠正你专家不是「写更多代码的人」而是能在出偏时把 agent 拽回正确约束的人。卡住时新手会话约19%被判定为放弃失败且零行有效代码改动中级/专家大约5–7%。你可以怎么做把每条主指令拆成四块强制模板目标可观察结果非目标明确不改什么验收测试名 / 命令 / 日志关键字风险边界数据、权限、回滚禁止「帮我看看 / 优化一下」作为唯一输入——这类指令在分类器眼里接近 novice。失败后先写约束再重生把报错、错误假设、你拒绝的方案写进下一轮而不是清空重来。问题 2团队为什么总把 AI 工具发给「会写代码的人」现象名额、账号、培训优先给研发业务、财务、法务、运营就算有清晰规则也很难申请到「能跑通端到端」的 agent 环境。根因旧假设是会写代码 能指挥代码 agent。新信号是在产出代码的会话里职业是否「写代码」对成功率的影响弱于任务专长管理类等职业甚至在部分可验证成功指标上不落下风——更像是会拆任务、会确认完成的技能在迁移。你可以怎么做账号与培训按「问题所有权」分配不按是否科班程序员。为非研发角色提供受控脚手架固定仓库模板、只读生产副本、一键测试脚本、禁止无审批的外网与密钥。绩效上奖励「写清规则 抓住边界 case」的人而不是「本周生成了多少行」。问题 3为什么你的 agent 会话越来越像「修修补补」现象周报里全是修 CI、修类型错误、修线上小问题新功能与数据/运维类工作推不动。根因早期 agent 能力不稳时自然会堆在fix模式。数据里七个月趋势是修 bug 占比近乎腰斩运维、数据分析、文档写作等占比上升——工具在从「补丁机」变成「交付面更宽的执行层」。若你的团队指标仍只统计「修了多少 issue」会系统性低估 agent 该去做的build / operate / analyze。你可以怎么做会话/工单打标至少四类build | fix | operate | analyze/write周会看占比而不是只看 fix 清零。给 agent运维与分析只读通道部署预发、查指标、拉日志避免只会改源码。估算任务价值可用粗口径对标外包报价或历史工时关注相对上升别迷信精确美元数。问题 4什么叫「成功」为什么你感觉 AI 很猛交付却对不上现象聊天里模型说「已完成」本地一跑就红或者 diff 很大但从未进主干。根因研究里区分了多层成功判定成功从对话看是否达成意图可验证成功还要有硬信号——测试通过、git 活动与工作匹配、用户明确肯定等只盯对话完成感会严重高估。新手与中级在「可验证成功」上的分叉比「感觉上差不多做完了」更大。你可以怎么做最小验收门禁每个 agent 任务关闭前勾这三条缺一不可命令级证据贴出测试 / lint / 关键路径手动验证输出版本级证据commit 或 PR 链接说明与需求的对应文件人的明确判定一句「接受 / 不接受 原因」禁止默认当成功没有硬信号的「看起来写完了」一律记为partial不得进发布清单。问题 5要不要追求「专家级」才能用 AI现象有人觉得「我不是大牛用 agent 也白搭」另一拨人觉得「反正模型会我不学业务细节了」。根因曲线形状很关键新手 → 中级跃迁最大中级到专家仍有收益但斜率变缓。含义是你不需要成为该领域的顶级专家才能吃到红利但你不能长期停在 novice含糊目标、不验证、卡住就弃模型变强时若「专长回报」开始下降才可能意味着判断力被模型部分接管——目前数据仍显示专长回报稳健你可以怎么做个人选一个本职高频任务用两周把验收清单写到「中级」——能指出模型常见错法。团队新人 onboarding 先教如何验收 agent再教快捷键。组织把「领域文档 / 决策记录 / 接口契约」当作 agent 生产力基础设施而不是可有可无的 wiki。本周可执行步骤建议直接抄进迭代天动作完成标志Day 1给团队发「目标/非目标/验收/边界」四段指令模板模板进仓库.ai/TASK_TEMPLATE.mdDay 2抽查 10 条历史会话标 novice/intermediate至少 5 条补上验收命令Day 3非研发角色选 1 个真实小任务走通受控脚手架有测试或脚本输出截图Day 4工单增加 work mode 标签看板能看出 fix 是否过高Day 5关闭任务强制三证据命令/git/人判无证据不得点「完成」边界避免误读这是交互式会话的隐私保护分析不覆盖大量 headless / 第三方 IDE / SDK 嵌套用法。成功与专长依赖分类器与遥测交叉验证不是追踪代码上线后的真实业务 ROI。任务「价值」来自与自由职业帖的粗对齐适合看趋势不适合当财务报表。职业推断约覆盖 70% 会话「管理类更高」也可能部分来自更爱在对话里明确确认。一句话收束Agent 正在降低「会不会写代码」的门槛同时抬高「懂不懂问题」的回报。别再把升级套餐当主策略——先把规划权、验收权和领域约束抓回自己手里多数人从新手走到「够用的中级」收益就比再堆十条万能提示词大得多。参考来源原文Agentic coding and persistent returns to expertise2026-06-16https://www.anthropic.com/research/claude-code-expertise

相关新闻