尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

AERS eval-harness 评测指南:41个行为场景 × 210项评分细则如何检验AI Agent的实证研究能力

AERS eval-harness 评测指南:41个行为场景 × 210项评分细则如何检验AI Agent的实证研究能力 AERS eval-harness 评测指南41个行为场景 × 210项评分细则如何检验AI Agent的实证研究能力【免费下载链接】Auto-Empirical-Research-Skills A curated collection of 23,000 agent skills for empirical research across 8 social science disciplines. | 精选 23,000 AI Agent 技能库覆盖8大社会科学学科的实证研究。CoPaper.AI 20分钟完成一篇可复现的规范实证论文并支持用户上传 Skills。-- Maintained by CoPaper.AI from Stanford REAP.项目地址: https://gitcode.com/gh_mirrors/aw/Auto-Empirical-Research-Skills在让 AI Agent 写实证论文时最大的隐患不是它不会写而是它写出看起来合理但推断上有错的文本。Auto-Empirical-Research-SkillsAERS开源了eval-harness/评测框架用41 个行为场景和210 项评分细则rubric自动检验Agent 加载技能后能否拒绝在小样本交错 DID 中报朴素 TWFE、能否在工具变量 F 统计量偏低时切换弱 IV 稳健推断、能否把 AER 摘要压缩到 100 词以内。它是一个零第三方依赖的打分器机器可判定项自动判分主观项生成评审提示词交给人或 LLM 评审——这正是评估 AI Agent 实证研究行为的一把标尺。一、为什么给提示词技能写评分细则AERS 收录的 23,000 技能大多是prompt-context提示词上下文而非可执行代码——没有函数可以做单元测试。那能测什么测 Agent 加载技能后输出是否具有正确的属性。每个评测由两部分组成定义在 eval-harness/README.md场景scenario一个真实感用户请求例如我用大学距离做工具变量估计教育回报第一阶段 F 约 8请像一篇严谨的应用微观论文那样报告结果评分细则rubric一份可检查属性的清单逐条判分。场景文件是 TOML 格式eval-harness/scenarios/ 下每场景一个文件文件名即场景 ID以 statspai-weak-iv.toml 为例它的 5 条细则包括必须报告第一阶段 F 值、必须把 F≈8 标记为弱工具变量、必须推荐 Anderson-Rubin 置信区间、不得出现F8 没问题这类虚假安慰regex_none检查禁用表述外加一条交人工评审的排他性假设讨论项。二、41 个行为场景覆盖实证研究的 8 大风险区场景按category字段归入 8 类对应实证研究中 Agent 最容易翻车的环节类别数量典型场景causal-identification因果识别20statspai-staggered-did.toml交错DID陷阱、aer-shiftshare-identification.tomlBartik 识别statistical-validity统计有效性8pyfixest-panel-clustering.toml面板聚类、statspai-rdd-diagnostics.toml断点诊断writing-compliance写作合规3aer-abstract-100words.toml摘要≤100词reproducibility可复现性3aer-replication-package.toml复现包结构citation-hygiene引用卫生3citation-hygiene-no-fake-refs.toml禁止虚构文献research-integrity研究诚信2econ-audit-recompute-not-restate.toml审计必须重算而非复述writing-style写作风格2english-deslop.toml去 AI 腔runtime-safety运行时安全1runtime-safety-replication-setup.toml拒绝陌生复现包中的危险指令每个场景还带severity严重级critical/high/medium/low——critical 场景强制配备鉴别性夹具见第四节因为仓库最依赖的检查恰恰是最不能赌在未经证明的细则上的地方。三、210 项评分细则8 种检查类型自动判分全部细则按检查类型分布为regex_any164 条、regex_none24 条、word_count_max1 条、regex_all3 条、regex_count_max4 条以及 21 条manual项。核心检查原语定义在 eval-harness/lib/checks.py检查类型通过条件用途regex_any至少一个模式命中必须出现的关键表述regex_none所有模式均未命中禁止出现的错误安慰word_count_max/min词数/字数/CJK 字符数达标摘要 100 词上限等numeric_tolerance/numeric_sign提取数字与期望值偏差/符号匹配报告数值是否算对manual永不自动通过转人工/LLM 评审两个设计细节值得新手注意section作用域检查可限定在文档某一段用正则捕获比如只统计改写正文里的 AI 腔套话避免误伤引用原句的变更说明非必需项与必需项分开计分required true的细则全库 151 条挂掉即整个场景不通过非必需项挂掉只影响分数不影响结论。四、鉴别性夹具评分细则自己也要被考试细则数量很容易注水——把模式写得宽泛所有场景全绿却什么都没测。AERS 的对策是给场景配夹具对eval-harness/fixtures/eval-harness/fixtures/场景ID/ pass.md 一份谨慎、正确的答案 fail.md 一份会语法但不懂推断的答案fail.md不是稻草人而是 Agent 真的会写、并且会理直气壮辩护的那种民间错误。自检命令 run_evals.py 的--selftest模式执行两条硬标准每一条自动可查细则必须在pass.md上通过——正确答案都满足不了的细则是坏细则不是严细则fail.md上至少一条必需细则必须失败——错误答案能一路冲过的细则等于没测。五、如何运行三条命令跑完评分流程整个框架只依赖 Python 标准库配合 scripts/toml_compat.py 解析 TOML无需 API Key# 1. 校验全部场景 覆盖率报告CI 门禁 python3 eval-harness/run_evals.py # 2. 对 Agent 输出打分生成 results/RESULTS.md 与 results.json python3 eval-harness/run_evals.py --grade eval-harness/candidates/_example # 3. 为人工/LLM 评审项生成即贴即用的 judge 提示词 python3 eval-harness/run_evals.py --judge-prompts /tmp/judge \ --grade eval-harness/candidates/_example要评测真实 Agent 时把每个场景的prompt带着指定技能喂给你的 Agent把回复存为candidates/运行名/场景ID.md再执行--grade。示例输出集 candidates/_example/ 是手写的评分夹具——其中一份刻意薄弱弱 IV 场景用于证明打分器本身能区分好坏。状态语义全部机器项通过、无必需项失败、无未决人工项才是pass只要还有未决的manual项状态就是needs-manual而非通过。这是一个刻意的必要非充分门禁全绿只说明没踩中已知雷区而失败则能证明答案是错的例如它把 F8 的工具变量说成强工具——这种不对称性正是一个廉价、常开 CI 门禁最需要的性质。六、诚实的局限别把它当论文质量证书eval-harness/README.md 明确列出了三条限制新手使用时应同样清醒正则细则粗粒度是设计使然它抓的是旗舰技能要防的特定失败模式不证明整体质量。绿色机器项 manual评审项才构成完整判断场景绑定编写时已验证存在的技能内容技能方法论变更时需同步更新场景自检只证明细则能区分一份正确 vs 一份错误答案排除了全匹配/全不匹配两种廉价失败模式但不证明细则在经济计量学上是正确的。结语评测层如何拼成完整闭环AERS 的评测体系是三层递进声明层的 docs/EVALS.md8 个旗舰技能评测提示词定义好长什么样→ 可执行层的eval-harness/本次主角把预期变成 CI 里强制执行的自动判分→ 数值层的 benchmark/20 类模拟数据任务的数值对标。对想评估自家 AI Agent 实证研究能力的新手建议从python3 eval-harness/run_evals.py开始读懂 schema/scenario.schema.json 后即可按 statspai-weak-iv.toml 的模板为自己关心的失败模式新增场景——让Agent 会不会做研究这个问题第一次变得可测量。【免费下载链接】Auto-Empirical-Research-Skills A curated collection of 23,000 agent skills for empirical research across 8 social science disciplines. | 精选 23,000 AI Agent 技能库覆盖8大社会科学学科的实证研究。CoPaper.AI 20分钟完成一篇可复现的规范实证论文并支持用户上传 Skills。-- Maintained by CoPaper.AI from Stanford REAP.项目地址: https://gitcode.com/gh_mirrors/aw/Auto-Empirical-Research-Skills创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表