
卸下历史的包袱SKILL.state 显式状态引擎如何让大模型智能体“轻装远行”谷歌Google LLC和普渡大学Purdue University联合发布一种名为SKILL.state的新型智能体运行架构旨在解决长文本模型在处理复杂、长期任务时常见的上下文膨胀和性能衰减问题。与传统不断追加对话历史的方法不同该系统利用显式的结构化执行状态来取代冗长的对话记录在每一步操作后都会丢弃中间推理过程。研究表明这种方法能够将提示词规模维持在常数级水平并在显著降低令牌Token消耗的同时提升任务处理的准确性与鲁棒性。通过在仓储管理、软件开发及各类公开基准测试中的验证该架构证明了其在长周期任务扩展和环境噪声抵御方面的显著优势。这种从“重构历史”向“维护状态”的范式转变为构建高效、低成本的自主智能体系统提供了新的技术路径。核心观点现有智能体运行时的局限性当前主流的 LLM 智能体运行时几乎普遍采用“对话式执行模型”。在长周期Long-Horizon任务中运行时不断向上下文追加观察、动作和中间推理导致 Prompt 长度随步骤呈二次方阶 O(T2)O(T2) 级累积膨胀极大地增加了 Token 消耗和推理成本并容易引发由于历史冗余信息积累而导致的上下文毒化和注意力漂移Attention Drag。SKILL.state 的状态转移机制论文提出了 SKILL.state 运行时架构将传统的“追加式对话历史”重构为“显式的、可变的结构化执行状态ΣtΣt”。在每个执行步骤中模型只接收三项输入不可变的技能规范PP、当前的结构化执行状态ΣtΣt和最新的环境观察OtOt。即时丢弃中间推理中间推理过程如 Chain-of-Thought仅作为产生状态更新和确定下一步动作的临时计算载体一旦状态 patch 验证并更新后这些推理轨迹会被立即丢弃不留存在后续的 Prompt 中。这一设计实现了渐近有界 O(1)O(1) 的单步 Prompt 大小以及线性 O(T)O(T) 的累计 Token 复杂度。外部环境漂移的零步恢复当外部环境发生静默漂移即环境在智能体动作之外被修改时依赖历史的系统由于受先前 Prompt 历史的误导会持续产生幻觉并需要多步调整而 SKILL.state 仅依赖当前观察和显式状态可实现零步即时状态恢复。局限性与充分统计量假设SKILL.state 假设执行状态能够成为未来执行的充分统计量。若任务场景无法预知固定 Schema、依赖先前未被记录的历史观察、或任务目标本身就需要解释/审计历史轨迹则该方案并不适用。关键数据长周期执行扩展性实验仓库管理领域使用 Gemini-3-Flash单步 Prompt 大小保持恒定随着执行步数从 T10T10 扩展至 T200T200SKILL.state 的单步 Prompt 大小始终保持在平坦的1,736 至 1,905 个 Token之间而基线由于历史累积呈二次方增长。极佳的 Token 节省率在T100T100时StatefulLangGraph 风格基线消耗了 1,062,387 个 Token而 SKILL.state 仅消耗65,408 个 Token节省约 16.2 倍。在T200T200时Memory 风格基线因历史累积膨胀至 6,175,509 个 Token 且准确率仅 0.84而 SKILL.state 仅消耗122,384 个 Token且保持0.94 的高准确率。公开交互式基准测试表现InterCode CTF100 个 Linux Bash 挑战任务SKILL.state 取得了54.2% 的首轮通过率Pass1相较于最强基线提升了7.8%比 Stateful 提升 12.4%并且比 ReAct 风格减少了60.4%的总 Token 消耗。Sierra ττ-Bench企业客服交互测试在Retail 零售场景下SKILL.state 的通过率达58.3%基线仅为 29.9% - 51.7%总 Token 消耗最少3.47M。在Airline 航空场景下基线单步 Prompt 常超过 11,000 个 TokenSKILL.state 保持了约2,800 个 Token的扁平化 Prompt实现了32.4% 的最高通过率比 ReAct 节省40.5%的 Token比 Stateful 节省45.4%。环境抗噪与状态恢复数据使用 Gemini-3-Flash高噪声抗干扰性在每步注入 50 个无关背景事件的高噪声测试中普通 Prompt (ReAct) 的任务完成率降至0.53而 SKILL.state 依然保持了0.98的极佳准确率。即时恢复零延时在模拟外部物理状态漂移测试中例如物品被静默移走传统的 Prompt、Memory 和 Stateful 基线由于历史文本误导需要5 到 8 步在软件仓库实验中甚至需要8 到 14 步才能消除幻觉回归正常而 SKILL.state 在所有漂移场景中均保持了0 步恢复。Token 预算控制对比将所有运行时限定在与 SKILL.state 相同的硬性 Token 预算~1,800 tokens步数 T100T100下时滑动窗口截断Truncated由于遗失早期分配信息准确率骤降至0.18使用 LLMLingua 统计压缩仅得0.22而 SKILL.state 依靠结构化状态能维持0.94 的高分证明结构化状态具有无法被统计压缩替代的精确依赖保存能力。开源模型错误分类Gemma-4-31B at T100T100针对开源大模型在长周期中出现的失效原因分析显示68%的失效源自过早的状态覆写/删除即模型在更新状态时遗漏了已有 Key未能进行原地 merge20%源于Schema 理解和类型强转问题仅有12%是由于JSON 语法及格式错误。https://arxiv.org/html/2608.26263v2