尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

LoopX ML Experiment能力实战:假设、证据与提升/停止门槛一图看懂

LoopX ML Experiment能力实战:假设、证据与提升/停止门槛一图看懂 LoopX ML Experiment能力实战假设、证据与提升/停止门槛一图看懂【免费下载链接】loopxLong-horizon agent control plane for durable, governed work across Codex, Claude Code, and other harnesses.项目地址: https://gitcode.com/GitHub_Trending/lo/loopxLoopX ML Experiment 是 LoopX 控制平面内置的「ML 实验领域能力包」它把一次模型迭代拆解为**假设hypothesis→ 证据evidence→ 判定提升/停止门槛**三步闭环用紧凑、公开安全的账本记录每轮实验并默认拒绝自动启动或停止任何训练任务——让你而不是 Agent掌握最后的发布决定权。️ 一图看懂200 小时实验轨迹先看图说话。下面这张脱敏后的轨迹图展示了 LoopX 在一次 200 小时的真实实验弧中如何保持决策线清晰哪些假设被保留、哪些证据被采信、哪些无效谱系被标记、哪些复现实验正在运行、哪些候选触发了提升或停止门槛——全部在同一张图上可见。它的设计意图很直白长时间运行的实验不应该依赖人的记忆而应该依赖一份可审计的状态账本。 三个核心概念假设、证据、门槛LoopX ML Experiment 围绕 loopx/domain_packs/ml_experiment.py 中的三个契约 schema 展开契约回答的问题关键状态hypothesis_ledger_v0假设台账我为什么做这个实验active / supported / weakened / retireddataset_window_contract_v0数据窗口契约基线和候选是不是在同一窗口对比窗口匹配才算数缺失窗口标记为「结论不可信」experiment_replan_v0重规划预览下一步该继续、扩窗还是放弃只给建议不启动任务⚖️ 提升/停止门槛一张判定表讲清楚最常被问到的问题是「指标涨了是不是就该上线」LoopX 的答案是——还要看护栏。核心判定逻辑见 loopx/domain_packs/ml_experiment.py实验结果护栏状态判定结论推荐动作主指标提升cleanpromote提升资格经 Owner/Registry 门禁后扩大窗口或交接主指标持平任意retire_or_replan停止/重规划放弃候选或设计机制上不同的新假设主指标回退任意no_promote不提升停止该方向并避免「近邻实验」盲目重试指标待出监控中任意monitor继续观察轮询到同窗评估结束再下结论护栏failedfailedblocked被护栏拦截先修护栏再谈探索任务失败/中止—needs_repair需修复修复启动或评估路径后再重试两个防坑设计值得注意训练集指标只能当护栏用train_metrics_are_guardrails_only训练曲线好看 ≠ 可以上线结论必须在对齐的评估窗口上产生。失败要归因失败行会带上紧凑的失败标签如「checkpoint 缺失」「环境路径错误」而不是把原始日志塞进状态里避免 Agent 拿着一堆噪声重复试错。 安全默认默认关闭权限三级LoopX ML Experiment 默认是off advisory形态见 build_ml_experiment_domain_pack_contract能力分级如下自主级别能做什么不能做什么suggest_only发现「这像个 ML 实验」并建议开启不写实验结论advisory写紧凑结果、假设台账、重规划建议不启动/停止/重启任务、不同步生产delivery在目标边界、配额与门禁内执行授权动作仍须显式授权 配额 预检 回写所有输出都带launch_actions_enabledfalse、production_actions_enabledfalse并且会把私有路径、凭据类内容自动脱敏为redacted:digest句柄——账本可以公开分享敏感信息进不了状态。实验状态默认落盘到项目本地的.loopx/domain-state/goal-id/ml_experiment/ledger.jsonl项目级、gitignore不污染核心控制平面。 快速上手一条 preview 命令试跑算法同学可以零风险试用 advisory 形态——preview不写状态、不启动任何东西完整示例见 docs/product/domain-capability-packs.mdloopx ml-experiment preview --format json \ --experiment-id exp_preview_v1 \ --primary-metric offline_auc \ --baseline-value 0.421 --candidate-value 0.437 \ --guardrail-status clean \ --train-window train_2026w24 --eval-window eval_2026w25 \ --hypothesis-id h_route_mix_v1 \ --mechanism-family candidate retrieval mix --route route_mix \ --positive-evidence offline_eval_delta_positive \ --next-candidate holdout_eval返回的四段结构正好对应本文的主线结果判定 → 数据窗口 → 假设台账 → 重规划建议。 延伸阅读与源码导航能力包设计文档docs/product/domain-capability-packs.mdML 实验领域包源码loopx/domain_packs/ml_experiment.pyCLI 命令注册preview / volc-task-packet / volc-result-ledgerloopx/cli_commands/ml_experiment.py顶层兼容入口loopx/ml_experiment.py主指标升降判定实现classify_primary_metric_delta提升/停止结果路由实现_volc_result_outcome一句话总结LoopX ML Experiment 把「假设—证据—门槛」固化为默认关闭、可审计的领域能力包让你在长时间模型迭代中既能看清提升路径也守得住停止线。【免费下载链接】loopxLong-horizon agent control plane for durable, governed work across Codex, Claude Code, and other harnesses.项目地址: https://gitcode.com/GitHub_Trending/lo/loopx创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表