
这项由Sylph.AI研究团队完成的技术报告发表于2026年5月论文编号为arXiv:2604.21003v3有兴趣深入了解的读者可以通过该编号在arXiv上查阅完整原文。---一个困境每次换新任务就得重新搭一套舞台假设你是一家公司的IT主管你刚刚花了三个月时间请来一批顶尖工程师给公司的AI助手精心打造了一套运行环境——包括它能用的工具、它理解任务的方式、它如何一步步执行操作、遇到错误时如何反应。这套环境就像是专门为一台精密机器量身定制的操作台少了任何一个螺丝机器就运转不灵。好不容易搭好了公司换了一个新业务场景。之前的那套操作台全部作废工程师们又要从零开始再花三个月。这正是当前AI代理AI agent领域面临的核心困境。AI模型本身已经相当强大但让它们真正干活需要一整套被称为脚手架harness的配套工程——包括给AI的指令、它能调用的工具、任务的执行流程以及判断它干得好不好的评估标准。每换一个应用领域这套脚手架就得重新设计、反复调试耗费大量人力和专业知识。Sylph.AI的研究团队把这个问题看在眼里提出了一个两层嵌套的自动化框架核心思想是与其让人来搭脚手架不如让AI自己学会搭脚手架更进一步让AI学会如何更好地学会搭脚手架。论文的标题就很直白地表达了这个野心——你最后一次需要手动搭建的脚手架。---一、什么是脚手架为什么它这么重要在讲这篇论文的核心方法之前有必要先弄清楚脚手架到底是什么。研究团队给出了一个简洁的公式**AI代理 模型 脚手架**。模型是那个经过海量数据训练、具备语言理解和推理能力的大脑比如GPT-4或Claude。但光有大脑不够你还需要给它配上眼睛、手脚、工作台和任务说明书——这些加在一起就是脚手架。脚手架涵盖的范围相当广泛。最基础的部分是给AI的说明书系统级的指令告诉AI它是谁、能做什么、有什么限制任务级的指令告诉它当前这个具体任务的目标和成功标准是什么。然后是工具集AI能调用哪些能力来跟环境交互比如读写文件、执行命令行操作、打开网页、搜索信息。再往上是基础设施AI运行所在的执行环境包括文件系统、沙盒容器、浏览器等。更复杂的脚手架还包括编排逻辑也就是控制AI行为流程的规则什么时候需要召唤一个子代理来协助任务在多个AI之间怎么交接遇到什么情况要回滚并重试。还有钩子和中间件——夹在AI决策和实际执行之间的质检员确保AI生成的代码能通过语法检查或者在AI跑偏时强制纠正。最后是模型配置用哪个模型、温度参数设置多少控制AI回答的随机程度、不同子任务分配给不同规格的模型。这些东西加在一起决定了一个AI代理能感知什么、能做什么、如何做。真实案例印证了这一点OpenAI的Codex、Anthropic的Claude Code这些工具本质上都是把大语言模型包裹在一套精心设计的脚手架里。OpAgent这个用于网页自动化操作的系统靠的是把规划者、定位者、反思者、总结者四个AI角色串联成一条流水线在网页浏览基准测试中取得了当时的最佳成绩——驱动这一成绩的很大程度上是脚手架设计而非模型本身有多强。但问题在于每一套优秀的脚手架背后都有大量隐形的人工成本。研究人员引用的一个例子是OpenAI工程博客描述的脚手架工程实践工程师们需要为AI定制代码检查工具、搭建专门的日志监控系统、集成浏览器开发者工具并建立层次化的文档结构就为了让AI能读懂一个特定的代码库。另一个例子来自Anthropic工程师们对评估提示词反复校准设计了四套评分维度来判断AI产出的设计质量是否过关还为不同阶段的任务在多个AI之间协商冲刺合约。这些工作需要深厚的领域知识和大量的试错迭代每换一个场景就得重来一遍。---二、内层循环让AI在干—评—改的循环中进化自己的脚手架Sylph.AI的解法从一个朴素的观察出发人类工程师调试脚手架的过程其实也是一个循环——让AI跑一遍任务看哪里出了问题根据问题改脚手架再跑一遍。既然这个过程有规律可循为什么不用另一个AI来自动完成这个循环这就是论文提出的第一层结构**脚手架进化循环**Harness Evolution Loop。这个循环由三个角色协同运转。第一个角色是**工人代理**Worker Agent。它是被优化的对象配备着当前版本的脚手架接到任务就去执行完事后留下一份执行日志记录它做了什么、看到了什么、每一步花了多长时间。第二个角色是**评估代理**Evaluator Agent。它不参与任务执行专门扮演挑剔的质检员。收到工人代理的执行日志后它干四件事对照真实环境状态检查工人代理的观察记录是否准确揪出那些以为自己做了但其实没做的情况逐条核对任务的成功标准给出每一条的通过或失败判断把总执行时间拆分为AI思考时间和工具执行时间两部分判断性能瓶颈出在哪里最后给出一个综合分数优先看有没有完成任务完成任务的情况下再比谁用时更短。第三个角色是**进化代理**Evolution Agent。它像一个经验丰富的高级工程师读遍所有历史尝试记录——每一个版本的脚手架长什么样、评估代理对它的诊断意见、得了多少分、比上一版是进步了还是退步了。基于这些信息它识别反复出现的失败模式然后动手修改脚手架可能是改一段系统提示词可能是修复一个工具的实现逻辑可能是调整任务执行的流程控制可能是换一个更合适的底层模型。这三个角色构成一个闭环具体运转方式体现在论文的算法一中。从一个初始的通用脚手架出发循环反复执行K轮每轮让工人代理跑一遍任务评估代理打分并诊断进化代理基于完整历史记录改出新版脚手架。每次改版之后系统会保留历史上得分最高的那个版本作为当前最佳进化代理每次改版时都以这个最佳版本为基础而不是直接在上一轮的结果上继续改——这样可以防止一次失败的尝试让系统一路跑偏。循环结束后输出历史最佳脚手架及其完整的进化历史。这个过程的精妙之处在于两点其一进化代理看到的不只是最新失败而是完整的历史记录这让它能区分偶发错误和系统性缺陷其二任务的成功标准被显式定义为脚手架输入的一部分评估代理有明确的依据而不是凭感觉打分。---三、外层循环让AI学会如何更好地教会AI搭脚手架脚手架进化循环解决了给单个任务自动调出好脚手架的问题。但研究团队注意到另一个问题这个循环本身的效果取决于评估代理和进化代理的提示词写得好不好、评分函数设计得合不合理、每次循环的执行逻辑是否合适。换句话说这个循环本身也是一套脚手架。这套循环脚手架用符号表示为Λ它包含四个组成部分工人代理本身、初始脚手架的起点、评估代理、进化代理。目前这四个部分是由人类工程师设计的在整个进化循环过程中保持不变。但如果Λ本身也能被自动优化会发生什么这就是论文提出的第二层结构**元进化循环**Meta-Evolution Loop。它的核心思路是把脚手架进化循环当作被优化的对象在大量不同类型的任务上运行它观察它收敛得快不快、最终效果好不好然后用一个元进化代理Meta-Evolution Agent来修改Λ让这个循环在新任务上能更快、更好地收敛。研究团队特别指出Λ和普通脚手架具有完全相同的结构它有提示词评估代理和进化代理的指令有工具评分函数、版本管理操作、代码编辑能力有观察内容从工人代理、评估代理、进化代理那里收集什么样的信息有编排逻辑循环跑多少轮、什么时候提交或回滚、任务怎么选取和排序。因此优化Λ和优化普通脚手架在本质上是同一件事只是抽象层次更高了一层。元进化代理可以调整的东西包括评估代理的提示词——要它重点关注哪些失败模式用什么标准打分需要什么样的证据才能判定某个条件通过进化代理的提示词——诊断失败时按什么思路分析优先考虑哪类代码改动改动幅度该保守还是激进工人代理的观察结构——从执行过程中暴露哪些遥测数据和中间状态评估代理和进化代理之间的信息流——每一步在两个代理之间传递什么信息评分函数的设计——是用当前的完成与否优先、再比用时两层结构还是改成多维度评分以及循环本身的超参数——迭代轮数、并行执行的程度、触发回滚的分数阈值以及何时停止迭代。算法二描述了元进化循环的具体运转方式。从一个初始的Λ出发每一轮对所有训练任务跑一遍脚手架进化循环汇总各个任务的最终得分取平均值作为Λ的综合评分然后元进化代理基于全部历史记录改出新版Λ。同样地系统保留历史上综合评分最高的Λ版本元进化代理每次改版都以它为基础。---四、这个框架和机器学习里的元学习有什么关系研究团队在论文中明确指出这个两层框架和机器学习领域里一个被称为元学习meta-learning也叫学会学习的概念高度对应并给出了一张清晰的对照表。在传统元学习框架里内层循环是在单个任务上对模型参数做梯度更新外层循环是在多个任务上评估当前的适应策略然后更新这个策略本身目标是找到一个好的初始参数和优化过程让模型能在新任务上用极少的梯度步骤快速适应。在本文的框架里内层循环是在单个任务上对脚手架H做迭代修改外层循环是在多个训练任务上评估当前的进化蓝图Λ然后由元进化代理修改Λ目标是找到一个好的蓝图让脚手架进化循环能在新任务上快速收敛到高性能。元学习里的模型参数对应这里的脚手架H元学习里的优化过程初始点优化器损失函数对应这里的进化蓝图Λ元学习里用梯度做参数更新这里用大语言模型做脚手架修改两者的最终目标都是快速适应新任务。这个对应关系不只是一个比喻而是说明两个系统解决的是结构上同一类问题如何设计一个适应过程使得面对新任务时适应的速度尽可能快、效果尽可能好。---五、怎么判断这套框架是否真的管用论文提出了一套评估协议。框架学到的最佳进化蓝图Λ最终要接受泛化测试——把它用在训练阶段从未见过的新任务上衡量它的真实表现。衡量的维度有三个。一是收敛速度脚手架进化循环需要跑多少轮才能让工人代理的表现达到一个预设的目标分数线轮数越少说明框架越高效。二是最终性能在固定轮数内工人代理能在新任务上达到多高的通过率三是鲁棒性在不同类型的新任务上收敛速度的波动有多大波动越小说明框架越稳定可靠。一个理想的Λ应该让内层的脚手架进化循环在任何新任务上都能以更少的迭代次数、更低的计算成本产出比人工设计的进化循环更好的专用脚手架。---六、这项研究的起点和终点研究团队坦承这篇论文目前还是一个框架性的理论提案配合了算法描述和形式化定义但尚未附上大规模实验数据。他们在论文末尾明确说明将用一篇后续论文来提供实验验证测试场景会覆盖那些即使用当前最先进的AI代理也难以自动化的复杂工作流程——包括企业定制化的客户服务流程和各类专业领域的行业应用。最终的产品愿景是任何用户只要指向一个新的任务场景系统就能自动进化出一个专门针对该场景调优的高性能AI代理全程不需要用户懂任何脚手架工程知识。归根结底这项研究在尝试回答一个很有意思的递归问题AI能不能替代人类来做让AI变得更好这件事在脚手架层面答案似乎是肯定的——至少在理论框架上这条路是通的。脚手架工程师的工作可能真的会被一个足够聪明的脚手架进化机器接管。而这个进化机器本身也可以被更高一层的机器来优化。这种自我改进的循环能走多远是一个值得持续关注的问题。---**QA**Q1脚手架进化循环和传统的提示词优化有什么不同A传统的提示词优化只调整AI收到的文字指令而脚手架进化循环可以修改整个运行框架包括工具实现、执行流程控制、观察数据结构和底层模型配置。本质区别是优化对象的范围提示词优化是微调说明书的措辞脚手架进化是重新设计整个操作台。Q2元进化循环需要多少训练任务才能学到有用的进化蓝图A论文目前是理论框架尚未给出具体的训练任务数量要求。研究团队计划在后续论文中通过实验回答这个问题测试场景会覆盖多种复杂的企业级工作流程届时才能给出量化的数据参考。Q3脚手架进化循环中的评估代理如何避免给出错误的诊断A评估代理采用了对照真实环境状态进行交叉验证的机制而不只依赖工人代理自己的执行日志这样可以发现工人代理以为自己做了但实际没做到的情况。此外成功标准在任务定义阶段就被明确列出评估代理有具体条目可以逐一核对减少了主观判断的空间。