尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

如何衡量AI Agent干得好不好?Awesome Harness Engineering 17个Evals与可观测性工具完全指南

如何衡量AI Agent干得好不好?Awesome Harness Engineering 17个Evals与可观测性工具完全指南 如何衡量AI Agent干得好不好Awesome Harness Engineering 17个Evals与可观测性工具完全指南【免费下载链接】awesome-harness-engineering️ Awesome tools guides for harness engineering.项目地址: https://gitcode.com/gh_mirrors/aw/awesome-harness-engineering你是否想知道AI Agent到底干得好不好awesome-harness-engineeringAwesome Harness Engineering是一份专注于 AI Agent 可靠性工程的精选资源清单其中的Evals Observability评测与可观测性章节一口气收录了17 个 Evals 评测与 Agent 可观测性工具覆盖如何设计评测、用哪些开源框架、怎么落地深度 Agent 评测三大方向。这篇文章带你 10 分钟读完这份清单挑出最适合你的那一个。为什么 AI Agent 需要 Evals 与可观测性传统的软件测试靠断言输入 A断言输出 B。但 AI Agent 的工作方式是多步规划 工具调用 环境交互成功路径可能上百种——结果对≠过程对Agent 可能蒙对答案也可能中途走捷径埋下隐患只看最终结果会漏掉回归问题长任务黑盒跑了几小时的编码 Agent 卡在哪一步、烧了多少 Token、哪个工具失败了没有trace链路追踪就无法定位⚖️模型升级≠系统升级换模型、改提示词、调 harness脚手架都可能悄悄改变表现需要可复现的评测集来守住基线这正是 Harness Engineering 社区的核心主张之一很多时候 Agent 表现差不是模型的问题而是环境 评测 观测这套 harness 没建好。想入门这个方向可以先从 README.md 的 Foundations 章节读起再回到本文的评测清单。3 分钟上手获取完整 Evals 资源清单如果你想通读全部 17 个工具并自行补充可以克隆仓库只读使用即可git clone https://gitcode.com/gh_mirrors/aw/awesome-harness-engineering核心内容都在 README.md 里Evals 章节位置如下 评测与可观测性章节README.md#L82-L100 公开 Benchmark 榜单章节README.md#L102-L145 资源收录标准判断工具质量的参照CONTRIBUTING.md#L30-L42 协议CC0 1.0可自由转载引用LICENSE17 个 Evals 与可观测性工具分类速览方法论篇把 Agent Trace 变成可复现评测5 篇指南这一组是怎么想的问题建议先读这一组再选工具工具/文章出品方一句话价值Testing Agent Skills Systematically with EvalsOpenAI用 JSONL 日志 确定性检查把 Agent 运行轨迹变成可重复跑的 EvalsHow to Evaluate Agent SkillsOpenHands用限定任务 确定性校验器 无技能基线三步法判断某个 skill 是否真的有用Agent evalsOpenAI产品级指南如何构建任务级 工作流级的可复现评测Evaluation best practicesOpenAI如何让评测集贴近真实任务分布、尽早抓住回归Trace gradingOpenAI直接给 Agent 的执行轨迹打分对多步骤长任务特别好用 核心思路先有 trace完整记录 Agent 做了什么再有 grader对 trace 打分最后固化为回归测试。工具篇开源 Agent 评测框架与追踪 SDK7 个这一组是怎么搭的问题是清单里实操性最强的部分工具类型适用场景Inspect AI开源评测框架英国 AISI 出品自带 solver / scorer / 沙箱 / 工具调用 / 日志查看器原语适合从零搭可复现的 Agent 评测 harnessAgentOps开源 Python SDKAgent 监控全家桶会话回放、成本追踪、基准测试、跨框架 traceagenttrace本地优先 CLI/TUI审计 AI 编码 Agent 的会话轨迹健康检查、成本尖峰、工具失败、延迟缺口还能做两次尝试之间的 diffax本地遥测 记忆图谱跨多个 Agent 运行时审计会话成本、技能、工具使用与 OTLP 事件flameox性能剖析工具包给 Agent 做性能剖析捕获 trace、保留原始证据、对比实验后再下结论Better Harness编码 Agent 工作流评审器把仓库与会话证据转成按优先级排序、可验证的 harness 改进项OpenTelemetry GenAI 语义规范行业标准为 LLM/Agent 工作流定义标准 span、metric、event让 trace 在不同观测平台间可移植 新手建议路径先用AgentOps或agenttrace把观测跑起来成本低、见效快规模上来后再用Inspect AI建正式评测集并用OpenTelemetry 规范保证未来平台迁移不踩坑。实践篇深度 Agent 评测与 harness 改进经验5 篇这一组是踩过坑的问题来自一线团队的复盘Demystifying Evals for AI AgentsAnthropic——当 Agent 有成百种成功/失败路径时到底该测什么Quantifying infrastructure noiseAnthropic——震撼结论运行时配置带来的基础设施噪声能拉动编码基准分数超过很多榜单差距Learning to Verify AI-Generated CodeOpenHands——用生产轨迹训练轨迹评审器做重排序、提前止损与评审期质量控制的分层验证栈Evaluating Deep Agents: Our LearningsLangChain——单步 / 全链路 / 多轮三种评测设计怎么搭配Improving Deep Agents with harness engineeringLangChain——实证只改 harness、不动模型基准成绩就能显著提升配套 Benchmark横向对比 harness 质量做完内部评测后可以用公开基准做横向校准。清单的 Benchmarks 章节 收录了 40 个基准新手重点关注这几类️终端/编码类Terminal-Bench、SWE-bench Verified —— 测编码 Agent 的检索→打补丁→验证全链路Web 类WebArena、BrowseComp —— 测长程浏览与信息检索的上下文管理桌面类OSWorld —— 369 个真实桌面任务覆盖 Ubuntu/Windows/macOS⚖️综合榜GAIA、Agent Arena、HAL —— 快速对比不同 harness 方案的整体水位这些基准的共同点是比的是 harness 质量不只是模型质量——上下文处理、工具调用、环境控制、验证逻辑全都在考核范围内见 README.md#L104。新手选型指南3 步选对 Agent 评测工具第一步先观测再评测接入一个轻量 trace 工具agenttrace / AgentOps回答我的 Agent 到底在干什么、花了多少钱。没有 trace一切评测都是猜。第二步固化 10~20 个黄金任务从真实失败案例里挑出高频任务配上确定性校验器能跑测试就跑测试形成可复现评测集——这正是 OpenAI 与 OpenHands 两篇指南的共同起点。第三步用基线做 A/B每次改 harness提示词、工具、沙箱配置都跑一遍评测集并与无此改动的基线对比。Anthropic 的噪声研究提醒你跑分前先固定运行时配置否则差异可能来自环境而非改动本身。常见问题 FAQQ1只有一个小项目值得搭完整评测体系吗值得但可以从10 个任务 跑测试脚本的最小闭环开始。清单里 OpenHands 的 no-skill baseline 方法就是为小团队设计的。Q2Evals 和 Observability 有什么区别Observability可观测性是持续记录trace、成本、延迟Evals 是周期性打分用固定任务集量化质量。前者是后者的数据来源。Q3怎么判断一个工具值不值得加入自己的清单可参考本仓库的收录标准——要求一手来源、聚焦 Agent 的约束/评测/恢复/观测等具体机制、拒绝纯营销内容详见 CONTRIBUTING.md#L14-L18。下一步行动✅ 先精读 Evals Observability 章节 中方法论篇的 5 篇指南 ✅ 挑选 1 个 trace 工具推荐 AgentOps 或 agenttrace接入现有 Agent ✅ 用 10 个真实任务建立第一版评测集跑通改动 → 评测 → 对比基线闭环Harness Engineering 的本质就是给 AI Agent 装上一套仪表盘 体检中心。17 个工具里选对一两个、用出闭环你就跑赢了大多数还在凭感觉调提示词的团队。【免费下载链接】awesome-harness-engineering️ Awesome tools guides for harness engineering.项目地址: https://gitcode.com/gh_mirrors/aw/awesome-harness-engineering创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表