尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Agent 的能力不靠模型靠「装备」:NUS JIT-Agent 即时生成操作框架,最高涨 20.2 分还反超 GPT-5.6

Agent 的能力不靠模型靠「装备」:NUS JIT-Agent 即时生成操作框架,最高涨 20.2 分还反超 GPT-5.6 Agent 的能力不靠模型靠「装备」NUS JIT-Agent 即时生成操作框架最高涨 20.2 分还反超 GPT-5.6Hugging Face 每日论文2026-08-27 精选同一个大模型换一套「怎么用它的操作框架」成绩能差出 20 分。新加坡国立大学 LV-NUS 实验室 8 月 27 日挂在 arXiv 上的 JIT-Agentarxiv:2608.25593把这句话做成了可复现的实验模型权重一字不改只把 Agent 的「记忆怎么管、计划怎么排、动作怎么做、工具怎么调」这套外挂配置从人工手写换成模型即时生成几个主流开源模型在 DeepSearchQA、OdysseyBench、AgentIF 等四个 Agent 基准上的成绩集体上涨最高涨 20.2 分其中一款模型在 DeepSearchQA 上以 9.1 分反超 GPT-5.6。8 月 27 日这篇论文登上 Hugging Face 每日论文榜拿到 47 个 upvote。这件事对正在做 Agent 产品的研究者意味着当大家都在堆参数、换更大的模型时JIT-Agent 给出的是一条完全不同的涨分路径。它证明「Agent 的智能不只在模型权重里也在模型外面那层会随任务变化的外挂装备里」而这层装备第一次可以被另一个模型即时生成、即时修复、即时进化。为什么「怎么用模型」和「用哪个模型」一样重要过去两年训练 Agent 的默认思路是把推理和行动能力塞进模型权重模型越大越强Agent 就越强。这个思路对了一半。JIT-Agent 论文给出的判断是Agent 的最终能力由两个因素共同决定一个是产生推理与动作的基础模型另一个是把模型放到闭环执行环境里的那层 harness。harness 决定保留哪些历史、形成什么意图、暴露哪些工具、动作怎么执行、什么时候触发验证与恢复。「一个强模型放进错误的记忆、规划、动作协议里也会翻车」这句话听起来像常识但过去很少有工作把它当成一个可训练的对象来对待。JIT-Agent 的核心主张是把 harness 从「工程实现细节」提升为「和模型权重同等重要的一等公民」。它甚至更进一步提出一个问题如果 harness 这么重要为什么不让一个模型专门负责即时生成 harness论文里给出一个直观比喻模型是引擎harness 是变速箱和方向盘。同一台引擎配错挡位和方向盘的用法跑出的成绩天差地别配对了发动机的动力才能真正发挥出来。提前编译 vs 即时生成AOT 与 JIT 的分野harness 优化并不是全新方向最近一年已有不少工作在做 test-time harness 优化从轨迹和反馈里优化 harness 代码、prompt、工具、记忆、技能或控制策略。但 JIT-Agent 论文指出这些工作大多共享一个「提前编译」AOT, Ahead-of-Time假设把 harness 当成一个要长期优化的产物希望优化出来的结果能泛化到未来的任务、领域或模型版本。AOT 思路在部署分布稳定、同质时很有效但它要求优化循环在见到每个具体问题之前就先预编译出一套足够通用的 harness。问题在于不同任务需要完全不同的 harness 先验。广搜类任务适合并行证据探索终端类任务适合精简的串行 ReAct 循环深研类任务需要承载检索证据的工作记忆从自然语言到代码仓库的任务天然适合以文件系统为中介。合适的 harness 不仅随领域变化甚至随实例变化。JIT-Agent 给出另一种答案模型即 harnessModel-as-a-Harness。用一个经过训练的元模型meta-agent在见到具体任务的当下当场合成一套任务专属 harness然后任意一个现成的 Agent 模型在这个 harness 下执行。harness 不再是一个「提前编好的通用产物」而是一个「见到题就现场写」的即时产物。对比维度AOT 提前编译 harnessJIT 即时生成 harness何时构造见到任务前预先优化见到任务当场生成泛化方式靠产物泛化到未来任务靠生成器即时适配当前任务对任务分布变化的适应弱部署分布变则失效强每任务独立生成核心成本大规模搜索 海量轨迹积累训练一个紧凑的 harness 生成器代表系统多种 test-time harness 优化方法JIT-Agent四模块协议把 harness 变成机器可生成的产物要让模型能即时生成 harness第一步是把 harness 形式化成机器可生成、可组合的产物。JIT-Agent 论文给出的做法是固定一套四模块协议第一记忆模块。决定 Agent 保留哪些历史、遗忘哪些信息、如何组织长期与短期记忆。第二规划模块。决定 Agent 如何拆解任务、如何组织子目标、如何调度执行顺序。第三动作模块。决定 Agent 以什么协议与环境交互是串行 ReAct 循环、并行探索还是别的执行范式。第四能力模块。决定 Agent 暴露哪些工具与技能、如何调用、如何做工具链编排。四个模块不是孤立的它们被组织成一个可执行、可状态化的协议。JIT-Agent 在推理时接收任务描述、协议定义、可执行工具注册表以及一小段从历史 harness 库检索到的先例上下文然后输出一个针对当前任务定制的可执行 harness。生成的 harness 再去包裹一个现成的 Agent 模型执行。这里的关键动作是「实例化」而不是「组合」。JIT-Agent 不是把几个固定模块简单拼起来而是根据任务结构实例化出不同的执行协议与状态组织。深研任务的 harness 与代码生成任务的 harness走的是两套不同的记忆组织、规划节奏与动作协议但它们都遵守同一个四模块协议。三种 harness 智能自适应、可靠、可进化把 harness 生成当作训练目标论文提炼出三组核心要求它们一起定义了「harness 智能」第一自适应性Adaptivity。生成的 harness 要匹配当前任务与底层模型。同一个任务换一个模型最优 harness 可能完全不同生成器要能跟着变。第二可靠性Reliability。生成的 harness 必须可执行、行为稳定合成失败时还要能恢复不能生成一套跑不起来的配置。第三可进化性Evolvability。执行过程中积累的反馈与轨迹要能被转译成更强的未来 harness让整个系统越用越强。围绕这三组要求JIT-Agent 走的是一个三阶段训练配方。第一个阶段面向自适应在协议诱导出的 harness 空间里训练生成器学会按任务合成合适配置第二个阶段面向可靠性训练生成器在合成失败时识别并修复保证可执行第三个阶段面向可进化性让生成器从不断扩充的历史 harness 配置库里蒸馏性能信号实现自我进化。训练完成后生成器本身是固定的但它在推理时生成的 harness 会随任务与反馈不断演化。智能维度要解决的核心问题训练阶段运行时表现自适应生成的 harness 匹配任务与模型阶段一任务适配合成每任务现场生成专属配置可靠保证可执行并能在失败时恢复阶段二失败识别与修复合成失败自动修复重试可进化把执行反馈变成更强的未来 harness阶段三历史配置蒸馏越用越强,harness 库持续扩充权重不动、分数涨 20 分四个基准的实验结果JIT-Agent 的实验横跨 DeepSearchQA、OdysseyBench、AgentIF 与工作区类任务四个代表性 Agent 基准覆盖深度研究、日常任务、规划、工作区四类场景。论文给出的核心结果分三块第一块用 JIT-Agent 当 harness 助手后一款开源模型在 DeepSearchQA 上拿到 9.1 分、在 OdysseyBench 上拿到 4.3 分反超 GPT-5.6。这是「不换模型、只换操作框架」就能打败更大模型的直接证据。第二块另一款本身已经很强的开源模型在 JIT-Agent 生成的 harness 帮助下最高涨 20.2 分。说明「强者配好装备」的增益比「弱者配好装备」更夸张基础模型越强正确 harness 释放的潜力越大。第三块在受控对比评测里JIT-Agent 生成的 harness 与成熟 Agent 运行时 OpenCode、Claude Code 的默认配置性能相当同时能一致改进多个规模的模型家族。也就是说它不是只在某个特定模型上有效而是对多代际、多规模的开源模型都稳定涨分。评测对象基准结果开源模型 A JIT-AgentDeepSearchQA9.1 分反超 GPT-5.6开源模型 A JIT-AgentOdysseyBench4.3 分反超 GPT-5.6开源模型 B JIT-Agent最强基线的对应基准最高 20.2 分JIT-Agent 生成的 harness受控对比与 OpenCode、Claude Code 性能相当多规模开源模型家族四个基准一致改进第三块数据里还有一个常被忽略的工程含义JIT-Agent 是「紧凑」模型作为 harness 生成器的成本远低于再训练或再买一个更大的主模型。把「模型变大」这条路的边际成本换成了「装备即时生成」这条路的低边际成本。这正好对上了论文反复强调的一句话harness 智能是独立于模型规模、可训练、可迁移、可叠加的能力维度。为什么「即时生成」在工程上成立「当场生成 harness」听起来像多绕了一层工程上真的划得来吗论文给出的逻辑有三层第一层harness 是实例相关的。不同任务需要不同 harness这个事实让「提前编译一个通用 harness」这件事天然低效。与其在巨大的设计空间里搜索一个能覆盖所有任务的产物不如训练一个紧凑生成器在每个任务到来时只生成针对它的配置。后者省掉的搜索成本远大于生成器本身的推理成本。第二层harness 是低频更换的。一个任务跑起来之后harness 可以稳定用很久中途只需按反馈做小修。所以「即时生成」的成本是一次性的而收益是整次任务全程的。第三层harness 库是可累积的。每跑完一个任务生成的 harness 与它的执行反馈会回到历史库里成为下一次生成的先例上下文。这是一个复利结构跑得越多生成器能参考的好配置越多后续任务涨分越快。这三层加在一起回答了「为什么不是预先优化而是即时生成」这个根本问题。它不是工程上的倒退而是把 harness 设计从「一次性人工工程」改造成了「持续自我进化的生成式基础设施」。留给 Agent 研究者与工程团队的三件事第一件把 harness 当成和模型权重并列的一等公民来优化。JIT-Agent 用 20.2 分和反超 GPT-5.6 的结果证明模型外那层操作框架的增益一点不比换更大的模型小。预算有限时先看看是否还能在 harness 层挤出分数。第二件放弃「一套 harness 打天下」的假设。任务实例相关的本质意味着最合适的状态是每个任务类甚至每个任务实例都有自己的配置。与其维护一整套过度工程化的通用框架不如把精力花在训练一个能按需实例化的生成器上。第三件让 harness 配置沉淀成复利资产。执行反馈、任务轨迹、修复记录这些都应被持续回收进历史配置库成为下一次生成的先例。harness 智能不是一次性买断的能力而是会随使用次数不断叠强的能力。JIT-Agent 给出的不只是一个新模型而是把「Agent 为什么强」这个问题的答案从「模型权重」扩展到「模型 装备」两个维度。对 2026 年的 Agent 研究者来说这可能比再堆一个 10 倍参数的模型更值得关注。
返回列表