尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

腾讯:极少任务还原智能体全量评测

腾讯:极少任务还原智能体全量评测 标题Beyond Outcomes: Dual-View Relational Learning for Efficient Agent Benchmarking来源arXiv, 2609.18909v1️文章简介研究问题智能体Agent评测成本极高如何在大幅减少评测任务数量的同时依然能准确预测模型在完整基准上的得分和排名主要贡献论文提出了DualViewEval框架通过联合建模“最终结果”和“执行过程”两种关系实现了高效的基准压缩仅需极少任务即可高精度还原全量评测效果。重点思路构建六维过程指标通过分析大规模智能体执行轨迹提取了六个与最终性能系统性相关的过程信号包括智能体步数、工具失败率、工具类别熵、验证工具率、必要写操作执行率以及读写验证闭环率以此量化执行行为。双视角关系建模为每个任务构建两个关系矩阵。一是基于最终得分的“结果视图”捕捉智能体成败模式的相似性二是基于上述六维指标的“过程视图”捕捉执行行为模式的相似性弥补仅看结果的不足。端到端联合优化设计了一个包含直通硬Top-K门控机制的选择器确保选出的子集大小严格固定。将结果和过程关系矩阵融合为智能体内核输入到核岭回归预测器中。通过最小化分数预测误差和排名损失反向传播同时优化任务选择逻辑和预测模型参数。动态平衡权重引入可学习的全局系数自动调整过程视图在融合内核中的权重使模型能根据不同基准的特性自适应地平衡结果与过程信息的贡献。分析总结显著降低评测成本在APEX-Agents和BFCL等五个基准上仅用20个任务即可实现24至40倍的压缩比大幅节省时间和API费用。预测精度超越基线相比最强的现有方法SparseEvalDualViewEval将平均绝对误差降低了14.5%至28.2%并在SWE-bench Verified上将Kendall’s τ排名相关性提升了最多7.2%。过程信息至关重要消融实验证明单独使用过程关系或结果关系均不如两者结合效果好。过程视图提供了结果无法反映的行为结构信息尤其在任务预算极紧时优势明显。具备诊断价值选出的迷你集不仅能预测分数还能清晰揭示不同智能体在工具使用广度、验证习惯等行为上的能力差异为模型开发提供紧凑的诊断反馈。个人观点论文引入了“怎么做”的过程视角证明了智能体的执行轨迹如是否频繁验证、工具调用多样性蕴含着丰富的冗余消除信息。
返回列表