尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

make check为什么骗不了人?AERS零依赖验证管线:从CI门槛到每次运行重算金标准的设计哲学

make check为什么骗不了人?AERS零依赖验证管线:从CI门槛到每次运行重算金标准的设计哲学 make check为什么骗不了人AERS零依赖验证管线从CI门槛到每次运行重算金标准的设计哲学【免费下载链接】Auto-Empirical-Research-Skills A curated collection of 23,000 agent skills for empirical research across 8 social science disciplines. | 精选 23,000 AI Agent 技能库覆盖8大社会科学学科的实证研究。CoPaper.AI 20分钟完成一篇可复现的规范实证论文并支持用户上传 Skills。-- Maintained by CoPaper.AI from Stanford REAP.项目地址: https://gitcode.com/gh_mirrors/aw/Auto-Empirical-Research-SkillsAuto-Empirical-Research-Skills简称 AERS是一个精选 23,000 AI Agent 技能的实证研究技能库覆盖 8 大社会科学学科由斯坦福 REAP 的 CoPaper.AI 团队维护。这个项目最硬核的地方是它为零依赖的make check验证管线设计了一条铁律每次运行时从原始数据重新计算金标准答案。无论 AI Agent 报出多漂亮的数字只要它没有真正算出来验证器都能识破。今天带你读懂这套骗不了人的设计。一、问题起点AI 跑出的漂亮数字你敢信吗用 AI Agent 做实证研究最大的隐患不是代码报错而是数字看起来对、其实没算对。一个没处理识别假设的管线可能自信地报出一个完美平衡的表格一段幻觉代码可能输出一串貌似合理的系数。AERS 的答案很直接检查器每次都会重新计算所有源自数据的金标准值再把候选结果和它们对比——候选者无法靠编造一个干净平衡表或讨好的效应值来通过。这个承诺写在 benchmark/README.md 里并由 benchmark/check_benchmark.py 在每次运行时强制执行。二、make check一条命令六道关卡打开 Makefile 你会发现make check只是六个检查项的串联关卡作用一句话解释validate目录、链接、元数据新鲜度检查说明书和实物一致python-compat全仓库 Python 编译兼容代码至少在 CI 矩阵里能跑test标准库单元测试不装任何第三方包eval-harness评测场景自检证明评分标准能区分好坏eval-smoke评分冒烟测试连故意答错的卷子也要能扣分benchmark数值基准重算核心防线见下一节关键设计是零依赖几乎每一道关卡都只用 Python 标准库CI 里连pip install都不需要见 quality-evals.yml 的注释 All steps are stdlib-only; no pip。零依赖意味着验证管线本身不可能偷偷改答案——门槛极低透明极高。三、金标准不是存档的,是每次重算的这是整套设计哲学的心脏。以基准测试中的rdd-recovery任务为例任务规格在 benchmark/tasks/rdd-recovery.toml数量值含义截断点处的真实效应3.000由构造已知每次从数据重算粗暴的跨截断均值差5.510把跳跃和趋势混在一起严重偏误局部线性估计3.000正确恢复真实跳跃注意第一行真实值不是写死在配置文件里的而是检查器每次运行都从随仓库发布的 CSV 里重新算一遍compute_truth分支见 check_benchmark.py。候选结果results.json里的每个数字都要和这些当场重算的金标准对账。防伪造效果是实打实的。README 里演示了一次作弊把候选文件改成声称完美平衡、正向朴素效应结果四条必需金标准全部失败——[FAIL]* honest-reported-numbers naive_att 2000.0 vs true -635.0; SMD[black] 0.01 vs true 1.668 Score: 2/15编造的数字和重算的真相对不上直接现形。目前基准覆盖 19 个任务从 benchmark/lib/lalonde.py观察性因果推断压测到 benchmark/lib/card.py工具变量再到 DML、分位数效应、合成控制等每个任务都配一个陷阱专门捕捉朴素管线的经典错误。四、从 CI 门槛到你的命令行aers-score 自检工具make check守住的是仓库自己的底线。而想让自己的Agent 接受同一场考试AERS 提供了 aers_score/ 工具包——同样零依赖纯标准库Python 3.9aers-score tasks # 查看考卷内容 aers-score describe rdd-recovery # 看某道题考什么、陷阱在哪 aers-score init ./my-run # 生成答题模板 aers-score grade ./my-run # 给自己打分两个细节体现了同一套不轻信哲学见 aers_score/README.md不重新实现评分逻辑aers-score直接加载check_benchmark.py的评分函数打印的分数和 CI 给参考管线的分数完全一致考卷不打包进安装产物金标准必须从数据重算数据集是考试的一部分打包第二份只会造成两份漂移。提交公开排行榜时也一样排行榜用仓库自己的评分器重新读取你的原始候选文件打分而不是相信你提交文件里写的分数。五、三步上手本地验证这条零依赖管线克隆并初始化git clone https://gitcode.com/gh_mirrors/aw/Auto-Empirical-Research-Skills一键引导make setup source .venv/bin/activate只装科学计算栈给一个演示关卡用跑完整门槛make check想先看哪里坏了、怎么修运行make doctor源码在 scripts/doctor.py如果想单独体验基准的重算魔法只需一条命令python3 benchmark/check_benchmark.py --strict它会逐任务重算金标准、对账、并输出每题得分。总结把信任变成可重算AERS 的验证管线给出了一条可迁移的设计哲学零依赖 门槛低、透明高验证器不需要第三方包也就没有隐藏行为的空间金标准每次重算 不可伪造任何报数都要和当场算出的真相对账CI 门槛与自检工具同源make check和aers-score用同一套评分器仓库和使用者考的是同一场考试。正如 docs/SCOREBOARD.md 提醒的那样基准是地板不是天花板——17/17 的满分只说明管线在这批确定性命题上没有掉进陷阱。但对实证研究而言先让数字骗不了人正是让结论站得住脚的第一步。【免费下载链接】Auto-Empirical-Research-Skills A curated collection of 23,000 agent skills for empirical research across 8 social science disciplines. | 精选 23,000 AI Agent 技能库覆盖8大社会科学学科的实证研究。CoPaper.AI 20分钟完成一篇可复现的规范实证论文并支持用户上传 Skills。-- Maintained by CoPaper.AI from Stanford REAP.项目地址: https://gitcode.com/gh_mirrors/aw/Auto-Empirical-Research-Skills创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表