
某企业的合同管理智能体处理两类任务。一类是从单份合同中提取签约方名称和合同金额——输入是一份文档输出是结构化字段推理步骤少上下文负载低。另一类是比较五十份供应商合同中的风险条款——需要逐份阅读、提取违约责任和争议解决条款、跨文档比对异同、输出差异分析报告上下文负载高推理分解需求强。两类任务最初都路由到同一模型简单提取用高能力模型造成预算浪费复杂比较用轻量模型时质量不达标。运维人员排查时发现路由规则只按是否涉及合同这一个维度分类没有区分任务形态、上下文负载和推理分解需求。两类任务在路由层看来是同一件事自然会被分到同一个模型。很多团队遇到这类问题的直觉反应是给所有任务都配高能力模型确保质量不出问题。但这带来成本失控简单提取任务用高能力模型每份合同的推理成本是轻量模型的数倍五十份合同累积下来差距明显。也有团队反向操作把大部分任务路由到轻量模型降成本但复杂比较任务路由到轻量模型后输出的差异分析漏掉关键条款、混淆相似表述人工复核成本反而更高。问题的根源不在模型本身而在路由机制无法区分任务的复杂度差异。问题可以从三个层面拆解。一类是复杂度维度不完整。当前的路由规则按关键词或任务类型分类没有从任务形态、上下文负载、推理分解需求、输出约束和业务风险五个维度评估复杂度。单份合同提取和五十份合同比较在任务类型上都是合同分析但在上下文负载上相差几十倍在推理分解需求上一个是一次提取、一个是多文档比对。历史表现数据被放在复杂度评估阶段使用但历史表现反映的是某个模型在这个任务上做得怎么样属于模型适配阶段的输入不应该影响任务本身的复杂度判定。另一类是能力硬筛选缺失。路由流程直接进入成本质量选择跳过了能力检查。但有些模型在能力层面就不适合某些任务上下文窗口放不下五十份合同、不支持工具调用、不支持目标语言、缺少合规认证。这些是硬性能力门槛不满足的模型不应该进入候选池无论成本多低、延迟多优。跳过硬筛选直接比成本会出现轻量模型成本最低被选中、但上下文窗口不足导致合同截断的情况。还有一类是质量评估和升级机制存在缺陷。质量评估当前检查的是输出是否包含推理步骤——这衡量的是输出格式而非内容正确性模型可以在推理步骤里写正确的格式但得出错误的结论。质量评估应该检查的是证据支持——结论是否有来源依据、Schema合规——结构化输出是否符合规范、任务覆盖——所有子任务是否完成、以及工具结果一致性——回答是否与工具返回矛盾。升级机制的问题是当低能力模型的输出不达标时系统把低能力模型的错误答案作为上下文传给高能力模型让它修正但错误答案不是可信上下文会污染高能力模型的判断。降级机制的问题更直接当系统排队积压时高风险任务被降级到能力不足的模型只因为那个模型队列短。针对企业智能体中模型成本与回答质量失衡的问题青山不语AI工作室采用多模型路由分级与成本质量平衡框架先根据能力和风险排除不合适的模型再结合任务复杂度、历史质量、延迟和成本完成路由并通过结果校验与升级机制修正错误选择。起始环节是复杂度评估。编排层从五个维度评估任务的复杂度任务形态——单文档提取、多文档比较、多轮对话、工具编排上下文负载——输入token量级推理分解需求——需要几步推理、是否需要跨文档关联输出约束——结构化Schema、字数限制、格式要求业务风险——错误输出的影响程度。历史表现数据不在这个环节使用它反映的是模型与任务的匹配效果属于模型适配阶段的输入。复杂度评估的输出是一个任务复杂度等级用于后续模型筛选。第二个环节是能力硬筛选。编排层在进入成本质量选择之前先检查候选模型是否满足硬性能力要求。检查项包括上下文窗口是否容纳任务输入、模态是否匹配——纯文本任务不需要多模态模型图文合同需要视觉能力、工具调用支持——任务需要调用外部接口时模型必须支持function calling、语言支持——中文合同需要模型具备中文能力、以及合规要求——涉及敏感数据的任务需要模型满足数据驻留或隐私认证。不满足任何一项的模型直接排除不进入后续选择。模型层级按实测能力、成本和延迟划分而不是按参数量或厂商标注的等级划分。第三个环节是质量评估。质量评估不检查输出是否包含推理步骤——推理步骤是格式问题模型可以写出完整步骤但结论错误。质量评估检查四个维度证据支持回答中的结论是否有来源依据能否追溯到输入文档或工具返回Schema合规结构化输出是否符合任务定义的字段规范任务覆盖所有子任务是否都完成了有没有遗漏工具结果一致性回答是否与工具返回的数据矛盾。质量评分可以来自用户反馈、人工抽检、自动评估结果或业务指标而不是单一依赖模型自评。第四个环节是升级与降级。当低能力模型的输出不达标时系统触发升级。升级时传递给高能力模型的是原始请求、已收集的证据和失败原因——不把低能力模型的错误答案作为可信上下文传递避免污染高能力模型的判断。降级的触发场景包括任务的实际推理深度远低于预期、历史达标率高、或队列积压导致延迟超限。但降级不是简单的模型高低切换——系统负载只能在候选模型都达到最低能力要求时参与选择。高风险任务不能因排队而降级到能力不足的模型即使队列积压也必须等待合格模型释放因为高风险任务的错误代价远大于延迟代价。多模型路由的问题核心不在于模型能力不够而在于路由机制是否具备分级筛选能力。复杂度评估解决了任务有多复杂的问题能力硬筛选解决了哪些模型有资格的问题质量评估解决了输出对不对的问题升级与降级解决了选错了怎么办的问题。四个环节中任何一个缺失路由机制都有可能在某个边界条件下做出错误选择。对于实际部署的智能体项目而言路由机制的设计和模型本身的能力同等重要——不能只关注模型能不能完成任务还要关注任务复杂度是否被正确评估、模型能力是否经过硬筛选、质量是否按正确维度评估、以及选错时升级机制是否能干净地传递上下文。