
Autoresearch:evals完全指南趋势与平台期分析如何告诉你该继续还是停手【免费下载链接】autoresearchClaude Autoresearch Skill — Autonomous goal-directed iteration for Claude Code. Inspired by Karpathys autoresearch. Modify → Verify → Keep/Discard → Repeat forever.项目地址: https://gitcode.com/gh_mirrors/auto/autoresearchAutoresearch是一个为 Claude Code 打造的自主迭代技能设定目标与机械指标后Agent 会不断执行修改 → 验证 → 保留/回滚的循环。而Autoresearch evals/autoresearch:evals是它的结果分析器能解析任何一轮迭代产生的*-results.tsv文件自动检测趋势、平台期plateau与异常并直接给出继续 / 停止 / 换策略的 Go/No-Go 建议。本文带你从零读懂趋势与平台期分析不再靠直觉决定该不该停手 一、为什么你需要 evals从感觉到证据Autoresearch 的核心循环见 README.md 的 How It Works 章节每一轮迭代都会把iteration / metric / delta / status等字段写入 TSV 日志。跑 25 轮后你手上只是一串数字真正的问题是指标还在增长还是已经触及天花板最近的丢弃discard是偶发还是策略已经失效继续跑 10 轮是浪费 token还是马上要突破了/autoresearch:evals就是回答这些问题的一站式分析命令完整说明见 guide/autoresearch-evals.md命令实现位于 claude-plugin/commands/autoresearch/evals.md。二、快速上手三种最常用调用方式/autoresearch:evals # 自动找最新的 *-results.tsv /autoresearch:evals --file coverage-results.tsv # 指定文件 /autoresearch:evals --recommend # 附上继续/停止建议如果目录下有多个结果文件它会列出清单让你选择找不到时则提示你提供路径。整个过程是一次性one-shot分析不会修改任何代码。三、趋势分析速度曲线告诉你动能在哪evals 把指标轨迹拆成速度段直观呈现增长动能的变化。报告中的典型输出是这样的Iterations 1–8: 2.1% avg delta (强动能) Iterations 9–15: 0.8% avg delta (放缓) Iterations 16–20: 0.1% avg delta (平台期)同时给出速度报告Velocity Report最佳迭代哪一轮贡献了最大单次提升biggest win最差保留提升最小但被保留的一轮Keep / Discard / Rework 比率衡量命中率 新手提示keep 率长期低于 50% 且 delta 持续缩小通常意味着当前策略已接近该 Scope 下的极限该考虑扩大范围或换方向了。四、平台期检测原理5 次迭代规则平台期plateau是 evals 最核心的判断。默认规则是连续 N 次迭代的 delta 低于 0.1%阈值可调即判定为平台期N 默认值为 5可用--plateau-window N调整。Plateau detected at iteration 16 — 连续 5 轮 delta 0.1%一旦检测到平台期evals 不会替你硬撑而是暂停并询问选项适用场景继续当前方法平台期刚开始怀疑是暂时震荡扩大 Scope小范围内可改动的已经用尽换策略连续丢弃、Guard 频繁失败停止并回顾结果目标已达成或收益已衰减项目里还附带了平台期分析的测试夹具例如 tests/fixtures/orchestrator/plateau-improving.txt持续改善型、tests/fixtures/orchestrator/plateau-stuck-unknown.txt停滞型可用于理解不同数据形态下判定逻辑的差异。五、异常信号三类值得警惕的警报除了趋势evals 还会主动标记异常Anomaly Flags连续丢弃ANOMALY: 4 consecutive discards at iterations 9–12—— 连续失败往往说明假设方向错了Guard 失败指标提升了但安全网如npm test挂了 3 次优化可能在悄悄破坏现有行为指标震荡数值在两个区间来回跳动如 187KB ↔ 203KB说明测量本身不稳定先修测量再谈优化⚠️ 这三类信号比单纯的涨/跌更有价值——它们告诉你问题不在努力程度而在方法。六、Go/No-Go 建议一句话决策加--recommend后报告末尾会直接给出结论官方示例RECOMMENDATION: STOP — plateau reached Baseline: 287KB → Current: 198KB (-31.7%) Goal achieved: YES (target was 200KB) Suggested next step: /autoresearch:ship --type code-pr --auto三种典型结论对应三条路径STOP 目标达成→ 直接进入/autoresearch:ship交付STOP 平台期未达标→ 扩 Scope 或换验证命令而不是盲目加轮数CONTINUE→ 趋势仍在上行保持当前策略七、边跑边分析循环内检查点--evals-interval不必等整轮结束才复盘。给任何循环命令加上检查点标记evals 会在中途自动插入简短报告/autoresearch Goal: Increase test coverage to 90% Iterations: 50 --evals-interval 5每 5 轮打印一份不超过 5 行的检查点报告区间起止、指标变化、keep 数、趋势方向 一行建议不中断循环。若平台期连续 3 个检查点被检测到evals 会建议提前停止。默认间隔是自适应的floor(总轮数/3)例如 25 轮的核心循环会在第 8、16、24 轮各检查一次。八、三种输出格式从人读到机器读格式命令用途text默认--format text控制台阅读最直观md--format md生成evals/…-report.md可附在 PR 里json--format json结构化数据供 CI/CD 解析JSON 输出包含plateau_detected、goal_achieved、recommendation等字段可以直接被流水线判断目标是否达成、能否放行到 ship。九、进阶evals 的 TSV 列自动识别evals 会动态检测列因此对 debug、security、scenario、reason 等所有子命令的日志都能分析metric/delta→ 趋势、平台期、递减收益status→ keep/discard 率、最长连胜、失败聚集guard→ 指标提升但 Guard 失败的比例severitydebug/security→ 严重级别分布hypothesisdebug→ 假设验证率缺少某些列时优雅降级而不报错并且向后兼容 v2.0.x 的旧格式 TSV老日志也能直接分析 ✅十、常见工作流组合场景用法循环结束后复盘/autoresearch:evals --recommend目标达成后直接交付/autoresearch:evals --recommend --chain ship分析 debug 会话/autoresearch:evals --file debug/*/debug-results.tsv --format md检查某次运行是否卡住/autoresearch:evals --file *-results.tsv完整的链式用法见 guide/chains-and-combinations.mdloop → evals → ship是官方推荐链路之一。小结趋势分析回答还有没有动能平台期检测回答是不是该停了异常标记回答问题出在方法还是运气默认 5 轮低于 0.1% 即判定平台期可用--plateau-window N调敏感度用--evals-interval N在循环中途就能拿到检查点报告避免白跑几十轮一句话原则让 evals 的建议替代直觉—— 数据说 STOP 时就 STOP把省下的迭代留给下一轮更好的 Scope 【免费下载链接】autoresearchClaude Autoresearch Skill — Autonomous goal-directed iteration for Claude Code. Inspired by Karpathys autoresearch. Modify → Verify → Keep/Discard → Repeat forever.项目地址: https://gitcode.com/gh_mirrors/auto/autoresearch创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考