尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

企业大模型 Token 成本怎么控:把理解和执行拆分的架构思路

企业大模型 Token 成本怎么控:把理解和执行拆分的架构思路 企业使用大模型的成本结构正在变得越来越具体。试用阶段大模型的花费往往被当作一笔实验预算很少有人细算。等到AI助手接入知识库、Agent开始参与业务流程调用量从每天几十次变成成千上万次账单上的Token消耗就成了管理层绕不开的问题。不少企业到这个阶段才发现大模型的成本问题很多时候并不出在单价上而出在使用方式上大量本不需要大模型参与的工作也被交给了大模型。Token是大模型的计费单位也是企业AI的新成本项大模型并不直接处理人类语言。输入的文字会先被切分成一串基本单元再转换为数字交给模型处理这个基本单元就是Token也是大模型服务最常见的计费方式。粗略来看一个汉字通常对应1至2个Token一个英文Token约相当于0.75个单词具体数值因模型的分词方式而异。Token的计费是双向的用户输入的内容和模型生成的回答都要计费而且多数服务商的输出单价高于输入。在多轮对话中历史上下文会被反复带入任务链条越长、携带的背景资料越多消耗增长得越快。对个人用户而言这可能只是订阅费里的一个数字对企业而言Token消耗会随着业务规模持续增长最终成为一项长期的运营成本。企业Token浪费主要出在两个环节企业使用大模型时一个普遍的倾向是把它当作万能处理器业务数据、操作手册、上百页的PDF都直接交给模型让它总结、判断甚至执行操作。这种用法在演示阶段效果明显进入规模化运行后浪费会集中体现在两个环节。第一个环节是让大模型承担确定性工作。固定格式的数据提取、表格搬运、系统间的数据录入规则明确、结果唯一传统脚本或RPA几乎不产生边际成本就能完成却被交给按Token计费的模型处理。第二个环节是重复输入背景信息。为了让模型理解一条特定业务流程每次调用都要重新发送数万字的背景材料真正与当次任务相关的信息只占其中很小一部分大量Token消耗在重复阅读上。Token成本如果不加控制大模型很难在业务线上大规模铺开。不少AI项目试点效果不错却在推广阶段因为成本难以预期而放缓。省Token的核心是把“理解”和“执行”拆开控制Token成本常见的技术手段有几类。一是上下文精简通过检索增强生成RAG只召回与当前问题相关的片段而不是把整份文档放进上下文二是缓存复用不少模型服务商已提供提示词缓存重复出现的系统提示和背景材料可以按更低的价格计费三是模型分级把简单分类、格式转换等任务交给更小、更便宜的模型复杂推理再交给大模型。这些手段都能降低单次调用的成本但在企业业务流程中更根本的一步是架构层面的分工大模型只负责需要理解和判断的环节确定性的操作交给不消耗Token的执行工具。具体可以分成两步。一是前置过滤数据进入模型之前先由系统完成抓取、清洗和结构化只保留决策所需的关键字段二是执行剥离大模型输出的是决策指令点击、下载、填表、录入这些动作交给专门的执行工具完成。RPA加大模型一种已在业务中跑通的分工这种分工在金融行业已经有落地实践。国泰海通证券的“金小智”数字员工基于金智维RPA与大模型的双引擎架构RPA负责在业务系统中精确执行操作大模型只在需要理解非结构化信息、做出判断时介入。资金核查时间由此从1小时缩短到8分钟效率提升85%。从Token的角度看这套架构的成本结构也随之改变。RPA先从系统中抓取数据并完成结构化处理交给大模型的只是精简后的关键变量输入端的消耗明显下降大模型输出的是一条简短的决策指令后续执行全部由不消耗Token的机器人完成输出端的消耗也被压到很低。行业里也有其他厂商在走类似路线。UiPath把Agent能力叠加在既有的自动化平台之上国内的实在智能、弘玑Cyclone等流程自动化厂商也在推进RPA与大模型的结合。各家的实现方式有差异但共同的思路都是让执行层承接确定性工作把大模型的算力留给真正需要理解的环节。哪些业务适合“大模型RPA”架构这套架构的收益取决于业务本身的结构。如果一项业务包含大量规则清晰、结构化的重复操作只在少数节点需要语义理解和判断例如对账、报送、资金核查、单据审核那么由RPA分流大部分工作量Token节省会比较明显。反过来如果业务本身低频、非结构化每次都需要模型进行创造性生成例如方案撰写、营销内容创作那么RPA能分流的部分有限这类Token支出本身就是必要成本。企业评估时可以先把一条业务流程拆成若干步骤逐一判断哪些步骤需要理解、哪些只需要执行。需要理解的步骤占比越低这套架构的成本优势就越明显。Token成本正在成为企业AI架构的评价指标过去评价企业级Agent关注点大多在模型能力和任务完成率上。随着调用规模扩大单位任务的Token消耗开始进入评价体系与稳定性、安全性一起影响一个AI项目能否长期运行。单纯的大模型更接近一个负责理解和生成的中枢要在企业系统里真正完成工作还需要执行层的配合。判断一套企业级Agent架构是否合理一个直接的观察角度是大模型的算力有没有被消耗在本该由规则和脚本完成的工作上。
返回列表