尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

AI客服在真实的智能体系统里发生的事故

AI客服在真实的智能体系统里发生的事故 你有没有想过一个AI客服助手明明能力很强能理解复杂需求能调用各种工具查订单、办退货、改行程但为什么用起来还是让人心里发虚原因很简单。它不是每次都稳定。同一个任务你让它做四遍可能三次做对了第四次突然抽风把你要退的商品换成了别的东西,把要退的商品ID填反了,或者提前执行了本该询问确认的操作。等你发现的时候,退款已经打出去了,订单已经改完了,覆水难收。这就是这篇论文要解决的问题。它叫CAST全称是Critique-Aware Supervision for Training中文可以理解成带批评意识的监督训练。它盯着的不是AI能不能把任务做对而是AI能不能每次都做对。这两件事听起来差不多但差距可能大到超乎你的想象。一个动作错了全盘皆输先说说这个问题到底有多棘手。想象一下你在网购平台上要求客服帮你换货。你说我买的这台数码相机变焦不够我要换成变焦最大的型号。客服助手需要先找到你的账户查你的订单看看这个订单的状态再去查相机的所有型号规格比较出哪个变焦最大最后执行换货操作还得问清楚你想用哪种方式支付差价。这一整套流程里只要有一步走错比如它把现在这台和要换的那台的商品编号搞反了或者它还没等你确认支付方式就直接把订单改了整个任务就废了。而且这种错误往往是**不可逆**的。订单已经提交退款已经打出去你没法按撤销键重来一次。这跟写代码不一样。写代码你运行报错了改改再跑一遍就行。但智能体在真实世界里做的很多操作一旦执行就是真的执行了退货就是退货了转账就是转账了。这种不可逆性是让研究者们头疼的核心原因。**论文提到一个关键的评估思路不能只看智能体在一次尝试中是否成功还要看它在多次重复尝试同一个任务时是否能稳定成功。**这个评估方式叫pass^kpass^k衡量智能体在k次独立重复执行同一任务时是否每次都能成功的指标。比如pass^4就是看连续做四次同样的任务是不是四次都做对了。这个指标比只看一次成功率的pass^1要严格得多也更接近真实使用场景的要求要理解这个差距有多大看一组数字就明白了。论文里用GPT-OSS-120B这个大模型1200亿参数去做客服任务测试pass^4的平均成绩是16.9%。而经过CAST训练的一个只有80亿参数的小模型体积只有前者的十五分之一pass^4反而做到了19.5%比大模型还高出2.6个百分点。这说明一个事实**模型参数量大不代表可靠性高**。一次性做对和每次都能做对是两种完全不同的能力。就像一个学生考试单次能考90分不代表他每次考试都能稳定考90分真正厉害的是那种波动很小、每次都在附近的人。为什么让AI自我批评这么难那既然知道问题出在哪直接让AI自己检查自己的操作不就行了现有很多做法确实是这么想的让一个批评者模型盯着执行者模型发现问题就叫停。但这里藏着一个更深的矛盾**要让批评者判断一个动作对不对它必须只用执行者当时能看到的信息去判断不能偷看未来的结果。**这个约束听起来简单做起来很反直觉。你想啊如果我是个事后诸葛亮知道最终结果是失败的我倒推回去找哪一步出错了这很容易。但如果我站在那个瞬间只看到用户说了什么、之前发生了什么、模型现在准备做什么我要判断这个动作是不是靴子落地前就已经出问题了这就难多了。论文里做了个很扎实的实验来证明这个难点有多真实。他们直接拿业界最强的几个模型当批评者包括GPT-4.1、Qwen3-235B这些庄重的大模型让它们去审查另一个模型Qwen3-32B做客服任务时的每一步操作。结果很打脸这些强模型当裁判反而把整体表现拖低了。GPT-4.1做裁判时pass^1从没有裁判时的31.7%掉到了22.8%pass^4从11.5%掉到了6.0%。为什么强模型反而帮倒忙论文里给出了一个很扎心的答案**这些大模型当裁判的时候太爱鸡蛋里挑骨头了。**具体数据是GPT-4.1把46.8%的正确动作都误判成了有问题逼着执行者反复推翻重来越改越乱最后浪费了大量时间和资源还没把任务做对。这就像一个新来的质检员因为怕承担责任看什么都觉得不对劲把本来合格的产品全部打回重做。生产效率没提升反而因为反复折腾拖慢了整条产线。**如果不控制这种过度谨慎批评的成本会比批评带来的收益更高**这也是为什么直接用现成的强模型当裁判效果不理想。CAST的解法先教会AI怎么写病历报告那CAST是怎么解决这个矛盾的呢核心思路可以概括成一句话**先培养一个专门的诊断医生用它诊断出的病历数据去训练最终的手术医生。**具体来说整个流程分成三步走。第一步是收集病例。研究团队让一个教师模型Qwen3-32B在同一批客服任务上反复跑五遍收集下来大量的行动轨迹其中既有成功的也有失败的。因为环境是动态变化的同一个任务跑五遍可能会产生五种不同的应对方式和结果这就为后面的诊断提供了足够丰富的病例样本。第二步是给每一步动作做体检。这一步用了一个叫**多智能体验证框架**的系统去分析每一个具体动作判断它是不是合理的。这个验证系统内部又拆成了好几个专门的小模型各管一块有的专门负责从大堆的规则里挑出跟当前这一步相关的规则规则提取器有的专门筛出候选工具工具提取器还有专门检查动作是不是幻觉的、是不是违反业务规则的、是不是选错工具的三个检查器最后由一个总协调器汇总所有意见给出最终的诊断结果和一段解释理由。这套流程为什么要拆得这么细因为一个错误可以有很多种表现形式。论文把错误归纳成三大类幻觉幻觉模型编造了信息比如它声称用户提供了某个订单号但用户实际上从没说过这个数字这是没有事实根据的臆想违反领域规则违反领域规则动作违背了业务方设定的政策比如按规定应该先跟用户确认再执行退款但模型跳过了这一步直接执行以及工具误用工具误用选错了应该调用的工具比如用户想退货模型却调用了取消订单的接口这三类问题的检测逻辑完全不同,所以论文没有偷懒用一个模型全部搞定,而是分工检查,最后汇总。这就像一个复杂的体检套餐血液指标、影像检查、心电图各自由不同的专科医生来看最后再由主任医师综合出一份诊断意见比让一个全科医生粗略扫一眼要靠谱得多。**如果不这样分开处理一个通用模型很容易在某一类问题上顾此失彼比如只盯着找幻觉而漏掉了政策违规。**第三步才是真正训练。用第二步产生的这些带着详细诊断理由的病例数据去训练一个真正的批评模型论文里叫它CAST-CriticCAST-Critic经过CAST框架训练的批评模型它学会了在只看当下信息、不偷看未来结果的前提下判断执行者提出的每一步动作是不是合理并给出结构化的解释理由训练好之后再用这个批评模型去重新监督另一批新的任务执行过程只把最终成功完成的那些批评增强轨迹筛出来用它们去训练最后的执行策略模型论文里叫CAST-PolicyCAST-Policy经过CAST框架训练的策略模型也就是最终真正拿去执行客服任务的AI它可以单独工作也可以配合CAST-Critic在推理时接受实时的批评反馈这里有个细节值得注意训练用的批评理由数据是有特权信息的标注的时候可以让教师模型偷看到标准答案作为参照但学生批评模型和最终部署的策略模型都不能偷看只能凭当下的信息判断。这种设计有点像师傅带徒弟批改作业。师傅改卷子的时候手里有标准答案对照着改改完之后把评语和扣分理由写清楚教给徒弟但徒弟以后自己上手判卷的时候是没有标准答案在手边的全靠师傅教过的经验去判断。训练出来的批评模型比大模型更懂节制CAST训练出来的批评模型效果怎么样论文给了一组很有说服力的对比。还是拿Qwen3-32B当执行者分别搭配不同的裁判做实验。用GPT-4.1当裁判pass^1掉到22.8%用Qwen3-235B当裁判pass^1掉到24.1%但换成CAST自己训练的4B批评模型pass^1反而涨到31.8%比不加任何裁判的31.7%基本持平甚至略有提升而pass^4从11.5%直接提升到15.9%。8B的批评模型更进一步pass^4达到19.5%。论文还专门画了一张混淆矩阵来解释这背后的原理。GPT-4.1当裁判的时候46.8%的正确动作被误判成有问题假阳性率高只有24.0%的正确动作被正确地放行不打扰。而CAST-Critic-4B的假阳性率只有13.6%正确放行率高达62.2%。**这说明CAST训练出来的批评模型学会了一种更精准的判断力它不是变得更宽容而是变得更懂得在什么情况下该出手、什么情况下该闭嘴。**论文里还给了一个具体的动作触发比例数据CAST-Critic大概只会对每个任务里33.2%的动作提出质疑剩下的它是信任的。这个比例听起来低但恰恰是因为它精准才没有陷入过度纠错的怪圈。这里还有个反直觉的地方值得多说一句。用CAST-Policy经过训练的策略模型配合批评模型跟用原本没训练过的Qwen3-32B配合同一个批评模型相比前者对批评反馈的抵触情绪要低得多。数据显示非微调模型有26%到40%的概率会拒绝接受批评意见坚持己见而CAST-Policy只有11%到26%。这就好比一个刚入职的新人和一个经过系统培训的老员工都被主管指出了同一个操作失误。新人可能会觉得我这样做没问题啊然后固执己见而经过培训的老员工更清楚哪些反馈是有道理的会立刻调整。这种更听劝的能力正是CAST训练带来的额外收益它不仅提升了批评者的判断力也让被批评的一方变得更愿意接受纠正。数据说话:小模型也能跑赢大块头现在来看看整体的实验效果。研究团队选了四个场景来测试零售零售τ-Bench基准测试中的场景涵盖商品退货、换货、地址修改等114个任务这是CAST训练时使用的场景属于见过的训练领域航空航空τ-Bench基准测试中的另一个场景涵盖机票预订、改签、取消等操作共50个任务电信和医疗健康电信和医疗健康来自τ-Trait基准测试的两个场景专门设计用来测试模型在面对不同用户性格、不同领域时的鲁棒性和泛化能力其中零售是CAST训练时见过的领域航空、电信、医疗健康是它压根没训练过的专门用来看它的泛化能力怎么样。在训练过的零售领域4B规模的CAST-Policy比基础模型pass^1提升了18.9个百分点pass^4提升了10.4个百分点。8B规模的表现更好pass^1超过基础模型15.9个百分点pass^4超过9.6个百分点。更有意思的是跨领域的表现。在完全没训练过的电信领域8B规模的CAST-Policy搭配同规模的批评模型pass^1达到38.9%pass^4达到27.8%比什么都没做的基础模型pass^1只有31.9%pass^4只有5.6%提升巨大尤其是pass^4几乎翻了五倍。下面这张表格摘取了论文里几个关键的对比结果数值为百分比加粗为该组最佳表现| 模型 | 零售Pass^1 | 零售Pass^4 | 电信Pass^1 | 电信Pass^4 ||---|---|---|---|---|| 基础8B模型 | 14.1% | 5.2% | 31.9% | 5.6% || 8B模型RFT训练 | 27.6% | 12.2% | 29.2% | 11.1% || CAST-Policy-8B单独运行 | **30.0%** | 14.8% | 30.6% | 11.1% || CAST-Policy-8BCAST-Critic-8B | 29.8% | 13.0% | **38.9%** | **27.8%** |这里要提一下RFTRFT拒绝采样微调Rejection Fine-Tuning一种常见的训练方法先让模型跑很多次任务,只挑成功的轨迹拿来训练模型,思路是只学好的例子这个对比很关键因为它排除了一种可能性,也就是说CAST的效果好,单纯是因为它用了更多训练数据。RFT同样是只挑成功案例训练,但它的pass^4提升幅度明显不如CAST。这说明关键不在于用了成功案例,而在于CAST额外注入的那层批评理由信息,教会了模型不仅要知道什么是对的,更要理解为什么是对的、错误可能长什么样子。论文还跟另外两种专门针对可靠性问题设计的方法做了对比一个叫PALADIN思路是靠训练模型从注入的工具失败案例里学会恢复另一个叫EvoTool靠不断进化调整工具使用策略。CAST-Critic-8B在pass^1、pass^3、pass^4上都超过了PALADIN二十个百分点左右也超过EvoTool两到四个百分点。这说明一个相对简单的执行者加批评者结构只要把批评者训练到位效果可以超过更复杂的失败恢复和进化式方法。代价换来了什么任何多出来的智能体协作层都不是免费的会带来推理时间和token消耗的增加。CAST也不例外。论文里做了详细的开销对比。用CAST-Critic当裁判会比纯粹的单步推理慢一些token消耗也会上升但跟另外两种同类框架IRMA和FAMA相比CAST的开销处在同一档次性能却更好。研究团队还专门做了个消融实验测试验证轮次这个变量。让批评模型对同一个动作最多反复纠正2到5轮看性能和开销怎么变化。结果发现性能不是越纠正越好的单调曲线反而有个甜蜜点。对Qwen3-32B来说3轮纠正的时候pass^4达到最佳对CAST-Policy-4B来说4轮的时候最好。这个发现很有实际价值,说明验证预算这个参数得看具体搭配哪个执行模型来调,不存在放之四海皆准的最优轮次数。这有点像给学生批改作文,同一篇作文让老师改两遍可能就够了,但有的学生你得跟他反复沟通三四遍才能真正把问题讲透,改的轮次多少要看学生本身的接受能力,而不是一刀切规定所有人都改三遍。写在后面读这篇论文的过程中,最让我觉得意外的一点,是那个越强的模型当裁判效果越差的实验结果。这跟我们平时的直觉完全相反,我们总觉得越聪明的模型判断力应该越准。但实际情况是,强模型在没有专门训练过怎么当裁判的情况下,会因为过度谨慎而变得不好用,四成多的正确动作被它错判成有问题,这个数字挺惊人的。这让我联想到一件事,专业能力和判断能力其实是两种不同的技能。一个特级教师未必天生就会当好一个考官,考官需要的是精准的分寸感,知道什么该扣分什么不该扣,这跟解题能力本身没有直接关系,需要单独训练。CAST这篇论文本质上就是在说,想要一个可靠的批评者,不能指望聪明自动带来靠谱,得专门给它上一课,教它怎么写病历报告,怎么区分幻觉、违规和选错工具这三种完全不同的病症。论文里还留了一个没解决的问题,现在CAST的批评只针对当下这一步动作对不对,不会去预判这一步会给未来几步带来什么连锁反应。如果哪天有人把这个预判未来影响的能力也加进批评模型里,会不会又是一次质的跃升?这个问题我觉得值得继续追下去。QAQ1CAST是什么ACAST是一种批评感知的训练框架专门用来提升AI工具调用智能体在长流程、多步骤任务中的可靠性。它通过训练一个专门的批评模型来诊断每一步动作是否合理再用这些诊断结果反过来优化执行策略模型让小模型也能达到甚至超过大模型的稳定性表现。Q2为什么用强大的模型当裁判反而效果更差A论文实验发现像GPT-4.1这样的强模型直接拿来当裁判时会过度谨慎把46.8%的正确动作误判为有问题导致执行模型被迫反复重来浪费大量资源却没提升效果。专门训练过的CAST批评模型误判率只有13.6%左右判断更精准。Q3CAST训练出来的小模型真的能超过大模型吗A是的。论文数据显示CAST-Critic-8B这个只有80亿参数的批评模型搭配后在pass^4这个衡量重复稳定性的指标上达到19.5%超过了参数量15倍于它的GPT-OSS-120B模型16.9%说明可靠性不完全取决于模型规模。
返回列表