
我这段时间最强烈的一个感受就是AI越强大我的活越多。刷到各种AI生成视频、AI写完整个项目、AI一键做PPT的演示时我总忍不住看一眼手边那一堆还没处理完的需求文档、测试报告和prompt调优记录然后陷入深深的自我怀疑AI到底替我干了什么它是不是偷偷把“干活”的定义改成了另一个版本然后继续把工作量原封不动地堆到我头上这个问题不是段子是我每天都在面对的切身体感也是很多团队在AI落地时会撞上的墙。这篇文章我想聊的不是“AI能不能替代人”这种老生常谈而是更贴近实际的困惑为什么AI的能力边界在肉眼可见地扩张我的待办清单却一点没变短甚至变得越来越长我会结合自己过去一年多里用AI做智能体、写代码、搭自动化流程的实际经历拆一拆这个怪现象背后的真实原因也分享一些让AI真正替自己减负的经验。如果你也正处在“AI很强但我很忙”的拧巴状态这篇应该对你有用。1. AI没有减少任务它把“做完一件事”变成了“做成一整套”先说一个最直观的误区。我们总觉得AI应该像电影里的机器人助手一样你给它一个目标它就默默把整个链条跑完然后把成品放在那里。但现实中AI只是把“干活”整个过程的前半段——也就是从无到有地生成素材——压缩到了几分钟后半段的清洗、校验、串联、调优、运维一样不少地留给了人类。以前我自己写一个报表分析脚本最花时间的是写那几百行逻辑代码可能要三四个小时。现在用AI生成同样的脚本五分钟就出来了。听起来好像省了三个多小时对吧但实际上脚本生成之后我得花半小时确认它的逻辑有没有隐含bug花一小时接入真实数据看输出是否合理再花一小时处理边界情况——数据缺字段了怎么办、日期格式不一致了怎么办、某个部门的数据权限怎么隔离。到最后我真正节省的可能只有一个小时。而因为这个脚本跑通了领导转头就问“能不能再接一下财务那边的数据顺便做个周报自动推送”于是下一轮需求来了我又开始新一轮的生成、验证、接入、维护。这就是问题的核心AI并没有减少任务它把单个任务的成本打下来了但把任务的规模和密度推上去了。以前你做完一件事可能就结束了。现在AI能做了大家默认你可以同时做五件事。需求方不是故意压榨你而是他们的期望被AI的能力锚定成了新的基线。你说AI强不强大强大。但它把你拖进了一个更长的流水线里。1.1 被拉长的任务链每一个“能跑通”的背后都有一串脏活我在用AI做数据清洗的时候体会特别深。原来清洗一份脏数据逻辑是固定的正则写好规则写死跑就完了。但现在AI可以学习语义可以把地址、人名、公司名这种非结构化信息自动归一化。听起来很美对吧可问题在于AI归完一版之后你永远不知道它的准确率是不是够高必须拿一份人工标注的结果去对。对完发现地名识别错了几个你又得给它加few-shot示例调temperature改prompt里的规则描述。这个过程的本质是什么是把原来“写规则”的成本变成了“写规则验收AI输出”的双重成本。规则本身还有可能一次写对但AI的输出每次都带随机性你每次都必须在“可不可以用”和“要不要再调”之间做判断。说白了你从做事的变成了管AI做事的但考核指标还是按“你自己做出来的成果”来算。这个中间多出来的验收和管理成本就是任务链被拉长带来的直接代价。还有一点也特别容易被忽略AI生成的产物你是要对它负责的。它不是文档草稿不是思维辅助而是一个会被集成到生产环境里的“半成品”。半成品和成品之间的那一段路永远是人在走AI只是在起点帮你跑得更快而已。1.2 高质量下限被抬高全员被迫学会“AI化作业”以前做一个方案写得中规中矩就能交差。现在有了AI方案的门槛直接变成了“结构清晰、逻辑严密、带数据支撑、附带三个备选方案”。因为大家都知道你能用AI做到这个程度你交一个朴素版本反而显得敷衍。这无形中让所有人的“及格线”都往上抬了一截。拿我自己写的技术文档举例。以前写个对接文档列出接口、字段、示例就差不多了。现在因为能用AI辅助我发现周围同事的文档动辄带架构图、带时序说明、带异常处理对照表甚至还有自动生成的代码示例。你要是不跟上文档评审的时候就会被点名。可是这些“多出来”的东西是谁写的还是我写的AI只是帮我把排版和措辞弄得更漂亮了。它在降低生成难度的同时把标准拉高了等于把全场的跑动距离整体变长了。这个现象放到任何岗位都成立。做PPT、写周报、回邮件的同事应该都懂以前邮件有错别字没事现在用AI过一遍只要还有错字或逻辑不顺就显得特别不用心。AI成了一个新的“质量下限基准”所有人都在为这个新下限买单。1.3 工具选择本身成了新的负担熟练使用每一种工具都是隐性工时另一个隐蔽的工作量来源是AI工具本身太多了。今天冒出一个开源模型明天冒出一个agent框架后天又有新的IDE插件内置了自动补全。你为了不落后就得持续试、持续切换。光是“选哪个工具最合适”这一问题就消耗了大量的时间。我为了找一个靠谱的AI编程工具前前后后试了Copilot、Codeium、通义灵码、Cursor、Windsurf每个都用了至少一周最后发现不同语言的补全效果差别很大而且插件版本迭代还特别频繁时不时就要更新配置。这个过程里代码一行没少写但工具折腾的时间搭进去不少。这种事没法让AI替你完成因为工具的体验是主观的必须自己上手。所以现在我更倾向把工具当作“仓库里的扳手”——够用顺手就行不再追着最新最热的换。但就算是这样隔三差五依然需要花半天到一天更新知识库、了解新版本特性这些全是AI时代新增的“隐形工作”。2. AI带来了一批新工种你以为解放了其实是换了一种忙AI不会让人失业至少现在它先让人“换工种”。你以为你是来用AI偷懒的最后发现你变成了AI的运营、教练、质检员和保姆。我把这个阶段称作AI时代的“新打杂”它不像以前搬砖那么累但在心智上的消耗一点都不低。2.1 提示词不是魔法它是一份翻译和沟通工作很多人以为写好prompt就像念咒语一句话扔进去AI就完全懂你的意思。实际上我踩过的坑是AI根本不懂“潜台词”。你说“写个好看的界面”它真的会给你一个白色背景、蓝色按钮的默认模板你说“帮我优化一下这段代码”它会给你重构得面目全非连你自己都看不懂。后来我学乖了prompt里必须把背景、约束、输出格式、参考风格全部写清楚。可问题是写得越细prompt本身就越长越长就越需要维护。我的prompt库里现在躺着几十条打磨过的模板每条都经历过至少四五次迭代。这哪里是“一句话的事”分明是写作、逻辑学、需求沟通三合一的工作。更麻烦的是不同模型的“脾气”不一样。同一个prompt在GPT-4o里效果很好换到Claude或国产模型上可能就发挥不稳定。为了让团队里不同工具的输出都能保持水准我经常得为同一个需求维护多个prompt版本。这活儿谁干只能人干。AI不会自己给自己调提示词至少现在的agent还做不到让我完全撒手。2.2 给AI“擦屁股”幻觉、编造、前后不一致才是日常如果说提示词是沟通成本那么处理幻觉就是纯纯的负担。AI生成代码的时候会一本正经地调用一个不存在的APIAI写文章的时候会编一个看似可信但完全虚构的数据来源AI做数据分析的时候会给你“计算”出一个明显超出合理范围的结果。每一次你都得像个侦探一样沿着它生成的逻辑去排查问题出在哪。我以前用AI生成过一个数据处理脚本它调了一个Python库的新方法看起来特别合理注释还写得头头是道。结果一运行直接报错说这个方法是2.0版本才有的我环境里装的是1.4。我花了一整天排查最后发现问题的根源根本不是我的业务逻辑而是AI基于记忆生成的“幻觉代码”。那一刻我是真有点崩溃因为排查它造成的问题比我直接写这段脚本的时间还长。这不是个例而是我几乎每周都会遇到的常态。AI越强它生成的内容就越自然越自然就越难发现它是错的越难发现就导致排查成本越高。以前代码报错报错信息起码是诚实的现在AI生成的代码很多错误是“语法上完全正确运行起来彻底无效”。2.3 人类的新定位验收员、修复员和程序员的缝合体当AI能完成80%的常规工作之后剩下的20%恰恰是工作量最重的部分。第一你要能判断AI的产出是否达标这就意味着你必须比AI更懂这个领域否则你连验收都做不了。第二AI产出不达标的部分你得看得懂它错在哪并且能自己动手修好。第三如果AI返回的结果连方向和思路都是错的你还得能带着它回到正确的轨道上。这就是所谓“一个人的活被AI放大成了三个人的岗位”你是需求的定义者你是AI的管理者你还是质量的最终负责人。这个缝合怪角色比过去任何一个单一岗位都更耗精力。我一度以为自己用AI之后每天能省出两三个小时结果那段时间反而天天加班到半夜因为我要么在调整AI的产出要么在修AI制造的问题。后来我才想明白AI并没有“替我干活”它只是把我从“亲手做事”变成了“指挥一件事被AI做出来”。而指挥本身就是一件极耗精力的事。3. 把AI放进生产环境真正的成本才刚刚开始如果你只是让AI帮你写点一次性文案、改改周报那它的确很香。但一旦你想让AI进入正式的生产环节——比如做一个智能客服、自动生成日报、辅助代码审查——那些隐藏的成本就会像潮水一样涌出来。3.1 数据准备是最大的无底洞模型再强也架不住数据脏我做过一个合同信息抽取的智能体一开始天真地以为把合同PDF扔给大模型它就能给出标准化的结构化字段。结果第一次测试批量合同的字段抽取错误率高达30%尤其是金额格式和日期格式五花八门。为了让准确率上去我需要整理一份覆盖各种格式例子的标注入参模板还要不断根据错误case给模型补充few-shot示例。前前后后我花了两周时间才把准确率稳定到95%以上。这中间使用最频繁的工具不是AI而是Python脚本和Excel。AI只是在最后一步帮我把抽取规则表达出来。这个过程给我最大的教训是AI的能力上限很高但它的发挥高度依赖数据质量。脏数据喂进去AI只会一本正经地输出脏结果它不觉得自己错了反而因为表达得太流畅会特别有迷惑性。3.2 评测是绕不过去的坎没有评测你根本不敢上线在开发环境里AI跑得再好都不代表上线之后它能稳定发挥。因为大模型的结果带有随机性你永远不知道同一个问题在线上会被答成什么样。为了让AI生成的答案、代码或文案保持稳定你必须建立一套评测集每次调整模型或prompt之后都在线下跑一遍回归测试看看有没有把之前好的case改坏。我在做AI客服的时候维护了一个包含400多个问题的评测集覆盖售前咨询、售后投诉、专业产品问题等场景。每次更新完prompt都要把400多个问题全部跑一遍逐项看回答质量有没有下降。你算算一次跑完可能要大半天而这样的评测我每周至少要做两三次。这些工作听起来没有技术含量但绝对不可省略——省略的代价就是线上出事故然后花更长时间救火。3.3 上线只是开始线上监控和BadCase分析是永无止境的AI真正进入生产环境后工作并没有结束反而进入了最磨人的阶段。用户的问题千奇百怪很多case是你在线下评测集里完全想象不到的。比如用户会在凌晨三点问“你们的系统为什么崩了”虽然系统根本没崩但用户就是不开心再比如用户会把一句中文问题拆成三段发过来你的机器人要么当成三个问题要么不知所云。每一个线上bad case都需要单独分析、单独调整策略这活儿永远做不完因为用户总能找到新的姿势绕过你的规则。我一度有个感觉AI不是在帮我客服而是在无限生成“客服的客服”。我每天的大部分时间就是在帮AI处理它的售后问题。4. 别急着说“AI错了”先重新理解一下我们该怎么“有聊”回到标题那个问题AI这么强大为什么我还是有干不完的活是我用错了还是AI本身就有问题我的答案是AI没错但我们对AI的期待模型错了。我们总希望AI是“结果替代品”给一个目标就吐出一个完整的结果然后我就可以躺着。但实际上AI更像一个“超级实习生”它上手快、执行力强、知识面广但你依然需要给它的工作定义边界、分配优先级、验证质量、处理它搞不定的尾巴。理解了这个定位你就会发现“有聊”这件事不一定是坏事。它恰恰说明我们正在做的事情里有大量AI无法独立完成的部分而这些部分往往是含着价值判断、经验积累和上下文理解的“人类特有工作”。如果你真的把所有活都交给了AI自己彻底变得“无聊”那反而说明你的工作价值也同时被清空了。4.1 忙是因为你的岗位正在从“执行者”变成“定义者”AI能够替代的是执行很难替代的是定义。什么叫定义就是要搞清楚“这件事该不该做”“做到什么程度算好”“哪些约束条件不能违背”“如果几个目标冲突了应该优先保哪一个”。这些定义层的工作以前往往被隐藏在日常执行里你不需要专门去思考因为光是执行就占满了你的时间。现在AI把执行时间压缩了定义问题的时间反而浮出水面了。你突然发现自己每天要回答很多以前不用想的问题这个需求的优先级是什么它的成功标准是什么它跟现有系统之间的冲突怎么取舍。回答这些问题比写代码要累得多因为它没有标准答案全靠判断力。但这也是AI真正帮到我们的地方它把我们从泥潭里拉上岸让我们看到自己要做的事原来有那么多值得细想的空间。4.2 AI真正的杠杆不在于“少干活”而在于“敢想更大的事”以前我接手一个项目想到要写的代码量第一反应是缩。现在AI能帮我快速搭出原型我敢接一些以前觉得投入产出比不划算的活。比如我会用AI把一堆历史日志做成立体化的可视化看板会拿agent去自动聚合多个数据源的信息生成每日摘要会给非技术同事做一套自助查询内部知识库的问答机器人。这些事的效果不是“让我变闲”而是让我能腾出精力去验证更多想法。我可能还是忙的但忙的内容从“重复劳动”变成了“创新和验证”。这种忙我会更愿意接受。所以与其追求AI让我彻底无事可做不如把AI当作一个放大器让自己做的事从“小范围”“低影响”变成“更大范围”“更高影响”。4.3 与其抱怨AI让你忙不如重新设计你与AI的分工最后说一点我自己实践下来比较有用的分工模式。先把任务拆成四类第一类是“AI能独立完成且质量达标”的直接交出去比如生成固定格式的文案、做代码样板、翻译文档第二类是“AI能做但需要人验收”的比如写代码、做分析交出去之后必须认真验收第三类是“AI只能辅助但主线必须人来定”的比如方案规划、架构选型、需求分析AI可以给素材和参考但决策必须自己来第四类是“AI完全做不了”的比如跨团队沟通、处理人情事务、判断业务价值这些只能亲自上。把任务分好类之后你会发现自己真正需要亲力亲为的部分已经比我以为的要少很多。真正让你忙到停不下来的往往不是第一类任务而是第三类和第四类任务被你错误地让AI插手了——它给了你一堆参考却把决策的复杂度变高了。分清边界之后你才能把AI用在该用的地方而不是在所有的方向上一起瞎忙。我自己的体会是AI并没有在某个环节“错了”它只是把我们的工作从“用手做”变成了“用脑管”。以前加班是体力上的透支现在加班是面对大量模糊判断题时的心智消耗。这两者只有后者是真正值得做的。所以别再指望AI把你变成躺在游艇上的人真正的价值在于它让你有机会选择把精力花在哪些“有聊”的事情上——而那些事才会带你去该去的方向。