尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Content Curation Rubric 实战指南:用 LLM-as-a-Judge 为 Agent-Skills-for-Context-Engineering 研究管线把守内容准入

Content Curation Rubric 实战指南:用 LLM-as-a-Judge 为 Agent-Skills-for-Context-Engineering 研究管线把守内容准入 Content Curation Rubric 实战指南用 LLM-as-a-Judge 为 Agent-Skills-for-Context-Engineering 研究管线把守内容准入【免费下载链接】Agent-Skills-for-Context-EngineeringA comprehensive collection of Agent Skills for context engineering, multi-agent architectures, and production agent systems. Use when building, optimizing, or debugging agent systems that require effective context management.项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-Skills-for-Context-Engineering本篇技术指南讲解 Agent-Skills-for-Context-Engineering 仓库中researcher/rubrics/content-curation.md这份内容策展评分卡它以 LLM-as-a-Judge 的方式决定一个外部来源是否有资格进入研究管线并通过四道硬门控Gatekeeper Triage、四维加权评分Dimensional Scoring、明确的决策阈值与覆盖规则Overrides把这段内容值不值得沉淀成 Agent Skill这一模糊判断转化为可复现、可审计的确定性流程。读完本文你将掌握这套评分卡的完整规则、加权计算公式、机器可读输出 JSON 的字段语义以及它如何与research_loop.py、validate_run.py和 skill-change 评分卡衔接形成从来源发现到技能落库的闭环。这套评分卡要解决的问题在 researcher/llm-as-a-judge.md 描述的自主研究循环中Agent 会不断从外部发现文章、代码仓库、论文等候选来源而真正需要的是可实现Implementable的工程原语——那些能直接编码进可复用 Skill 的具体模式而不是有趣的泛泛之谈。如果缺少统一标准会出现两类失控一是把空洞的营销文章混入语料库二是把高价值但证据不足的来源直接丢弃。Content Curation Rubric 正是为解决这一门控歧义而存在。文档开篇即点明其职责它提取了researcher/llm-as-a-judge.md中的可复用策略并解决了门控判定歧义——任何一道门失败即拒绝REJECT该来源除非人工显式覆盖override。这意味着评分卡不是打几分取平均的宽松筛选而是一条先过门、再打分、后裁决的刚性流水线。Gatekeeper Triage四道不可妥协的硬门所有候选来源必须先通过四道二元门控Pass/Fail全部通过后才能进入维度打分。任何一门失败立即记录REJECT并附带失败门编号终止后续流程——不进入评分阶段。门通过Pass失败FailG1 Mechanism Specificity定义了具体的机制、模式、指标、工作流或架构只给出改进提示词这类空泛建议不解释如何做G2 Implementable Artifacts包含代码、模式schema、提示词模板、图表、API 契约、配置或足以复现的操作步骤纯评论无任何制品或可复现流程G3 Beyond Basics覆盖高级的上下文、harness、记忆、工具、评估、多智能体或研究运维模式仅限入门内容G4 Source Verifiability作者或组织身份可识别且技术上可信匿名、无法验证或纯营销来源这套门控对应 researcher/llm-as-a-judge.md 中 EVALUATION_RUBRIC.md 的 PART 1GATEKEEPER TRIAGE设计其中对 G1 给出了更细的示例化判定标准例如带压缩比的递归摘要XML 结构化工具响应基于检查点的状态持久化带元数据的分面检索属于具体机制而提升准确性更好的提示词AI 最佳实践这类未说明机理的措辞则判为失败。G4 的技术可信参考了顶级 AI 实验室的生产工程博客如 Anthropic、Google、Vercel 等、同行评审论文、有公开代码贡献的公认从业者匿名来源与伪装成技术写作的营销内容直接出局。值得注意的是门控判定的不确定性处理原则无法确定某门是否通过时默认按失败处理Default to FAIL这与 researcher/llm-as-a-judge.md 中UNCERTAINTY HANDLING章节保持一致——门控是刚性约束宁严勿松。Dimensional Scoring四维加权评分通过全部门控后对四个维度分别按 0、1、2 三分制打分。仓库 rubric 给出的是简洁版判定标准researcher/llm-as-a-judge.md 的 PART 2 则提供了每个维度2Excellent / 1Acceptable / 0Poor的完整判据与示例指标二者必须配合使用。维度权重得 2 分得 1 分得 0 分D1 技术深度与可行动性35%附制品或精确步骤可直接实现有用但需读者自行解读没有实现路径D2 仓库相关性30%直接对应上下文工程、harness 工程或技能编写与仓库范围相邻超出范围D3 证据与严谨性20%有定量证据、基线、消融实验、公开日志或可复现方法貌似合理的经验报告无证据的断言D4 新颖性与洞见15%新机制、反直觉发现或高价值失败模式对已知思想的有用综合常识加权总分计算公式weighted_total D1*0.35 D2*0.30 D3*0.20 D4*0.15满分 2.0。公式与 researcher/llm-as-a-judge.md 中的total_score (D1 × 0.35) (D2 × 0.30) (D3 × 0.20) (D4 × 0.15)完全一致且其输出 schema 要求同时给出weighted_total与calculation_shown如(2×0.35) (2×0.30) (1×0.20) (2×0.15) 1.85确保每一分都有据可查。一个直观的权重意义D1 权重最高35%因为管线的使命是沉淀可直接实现的工程原语若内容再炫酷却无法落地实现对技能库毫无价值。D4 权重最低15%但也保留了反直觉发现/高价值失败模式的上浮空间——这与 researcher/llm-as-a-judge.md 中不要拒绝负面结果失败的实验同样有价值的偏见规避原则呼应。决策阈值与四条覆盖规则加权总分计算完成后按以下条件裁决裁决条件APPROVE全部门通过且加权总分 1.4HUMAN_REVIEW全部门通过且 0.9 加权总分 1.4REJECT任一部门失败或加权总分 0.9此外还有四条覆盖规则Overrides用于在特定边界条件下强制改变裁决即使常规阈值判定与之相反O1D1 0 → 强制REJECT没有实现路径直接否决O2D2 0 → 强制REJECT与仓库完全无关直接否决O3D3 1 且总分 1.4 → 强制HUMAN_REVIEW内容价值高但证据严谨性存疑必须人工核验声明是否可复现O4D4 2 且总分 1.4 → 强制HUMAN_REVIEW可能存在突破性洞见交由人工把关避免误杀。这一套阈值 覆盖双轨设计让高价值但证据不足的来源不会被直接拒绝也不会让看似高分但零实现路径的来源蒙混过关。Required Evidence每个通过来源必须附带的五类证据无论 APPROVE 还是进入人工复核评分卡都要求对来源附上完整证据链防止凭印象放行检索来源 URL 与检索状态retrieved / partial / failed针对每一道通过的门控给出具体的引用或转述证据——即G1 通过因为……这样的逐条对应一段话的机制总结mechanism summary候选技能影响评估新建技能、更新现有技能、仅作参考、或拒绝已知局限、缺失证据或假设。其中第 4 项直接对应 researcher/llm-as-a-judge.md 中的 SKILL EXTRACTION 环节对 APPROVE 的来源还需输出技能名VerbNoun 命名如PersistAgentStateWithFiles、所属上下文工程分类context_retrieval / context_processing / context_management / rag / memory / tool_integration / multi_agent、实现类型prompt_template / code_pattern / architecture / evaluation_method与预估复杂度low / medium / high。Output Shape机器可读的 JSON 输出与兜底策略评分卡要求使用 researcher/templates/source-evaluation.json 模板输出机器可读的结果。该模板定义了严格的字段结构evaluation_iduuid-v4与timestampISO-8601source块url、title、author_or_org、published_at、source_typepaper / engineering_blog / documentation / benchmark / code / talk / other、retrieval_statusretrieved / partial / failed、primary_or_secondarygatekeeper块G1~G4 各自的pass布尔值与evidence文本以及总verdictPASS / REJECT和rejection_reasonscoring块D1~D4 各自的reasoning与score以及weighted_total和calculation_showndecision块verdict、override_triggeredO1~O4 或 null、confidence、justificationextraction块mechanism、implementable_artifacts、failure_modes、candidate_skill_targetnew skill / existing skill / reference only / reject、candidate_skill_name、taxonomy_category、estimated_complexityhuman_review_notes。关键兜底策略如果模型无法产出合法 JSON评分卡明确要求——记录原始输出并转人工复核route to human review而不是静默修复评估结果。这一失败不可怕、掩盖失败才可怕的原则与 researcher/llm-as-a-judge.md 中只输出合法 JSON不得输出额外评论的输出契约互为表里。仓库中的真实执行样本从示例 fixture 看规则如何落地researcher/fixtures/source-evaluations/ 目录提供了两个可直接对照的评估实例是理解规则动态行为的最佳教材。示例一全门通过但触发 O3 覆盖的 HUMAN_REVIEWapproved-harness-source.json 评估了一个可执行的自主研究框架来源Karpathy autoresearch program 的公开仓库门控全部 PASSG1 证据为定义了带可编辑/锁定文件的自主实验循环这一具体机制G2 证据为提供了 program.md 指令、命令循环、结果日志与回滚策略G3 覆盖长时自主实验、指标完整性、失败处理G4 为可验证研究者维护的公开仓库四维打分D12可直接用 git、训练命令与结果解析实现、D22直接指导 harness 工程、D31有可运行代码与锁定指标但缺少广泛对比证据、D42受限可编辑面框架是有用的运作模型加权计算(2*0.35) (2*0.30) (1*0.20) (2*0.15) 1.8按常规阈值 1.8 1.4 本应 APPROVE但D31 且总分 1.4 触发 O3强制转为 HUMAN_REVIEW人工复核备注为用作通过门控但仍需人工复核经 O3来源的 fixture。这个例子生动展示了覆盖规则的设计意图来源极有价值但证据严谨性只有 1 分不能仅凭总分高就自动入库。示例二四门全败的直接 REJECTrejected-generic-source.json 评估了一个匿名Ten AI Tips来源G1~G4 全部失败无具体机制、无任何制品、只有基础建议、作者无法验证rejection_reason为Failed all content gates四维全部 0 分加权总分 0裁决 REJECT且不进入任何技能提取candidate_skill_target reject与 researcher/llm-as-a-judge.md 中 PART 6 的 Example B10 Prompt Engineering Tips Medium 文章四门全败形成双重印证——这正是评分卡要拦截的典型低质输入。在仓库中的工程化落地锁定面、状态机与发布校验Content Curation Rubric 不是一份仅供参考的文档而是被仓库的自动化脚本硬编码为不可篡改的约束。1. 作为锁定面Locked Surface受保护。在 researcher/scripts/research_loop.py 的LOCKED_SURFACES列表中researcher/rubrics/content-curation.md与 skill-change、harness-change 评分卡、机制注册表、校验脚本一同被标记为锁定面——运行状态机run-state.json会记录这些锁定面自治 Agent 只能在其可编辑面sources/、proposals/、reports/、logs/内操作不得改动评分标准本身。每次运行创建的 THREAD.md 也会显式列出该锁定面清单。2. 生成评估脚手架。同一脚本的create_source_evaluation()会从 researcher/templates/source-evaluation.json 加载模板生成一份source-evaluation-draft.json默认retrieval_status为 partial未提供 URL 则为 failed裁决预设为HUMAN_REVIEWconfidence: lowjustification 注明Draft scaffold. Complete gates and scoring after retrieval.四门默认全部 fail、四维默认 0 分——即草稿状态下不默许放行任何来源必须由后续检索与评分填实。仓库真实运行产物 source-evaluation-draft.json 正是这一脚手架的实际形态。3. 发布就绪校验强制执行规则。researcher/scripts/validate_run.py 的validate_source_evaluation()是评分卡的执行校验器它要求已完成的评估文件必须存在仅有 draft 则报错、retrieval_status必须为retrieved发布就绪的运行不允许 partial/failed、裁决为 REJECT 的来源不允许产出发布就绪的变更。同时validate_state()强制检查锁定面清单中必须包含researcher/rubrics/content-curation.md。也就是说一份评估只有经过检索成功 未被拒绝的双重校验才能继续流向技能提案。4. 与下游 skill-change 评分卡衔接。内容策展只是第一关。来源通过 curation 后researcher/rubrics/skill-change.md 会用 S1~S5 五道硬门独特激活场景、可实现的指导、语料适配、证据可追溯、维护者负担与另一套加权维度Actionability 30% / Relevance 25% / Non-Duplication 20% / Evidence 15% / Skill Ergonomics 10%同样要求加权总分 1.4 且无硬门失败来决定提取出的机制是否真正落入SKILL.md语料、是新建技能还是更新既有技能。两套评分卡形成先审来源、再审变更的两级闸门。使用这套评分卡的实践要点把门控当开关不要当打分项G1~G4 是 Pass/Fail 的硬门任何一门失败立即 REJECT绝不进入评分阶段不确定时默认判失败。给每一道门和每一个维度写证据输出 schema 中的evidence、reasoning字段就是为此设计引用具体内容如定义了 init.sh 模式、checkpoint 机制、progress.txt schema而不是空泛评价。让覆盖规则显式化每次触发 O1~O4 都要在override_triggered中注明并附human_review_notes说明人工复核的具体关注点如验证基准方法学、检查 3 层记忆架构是否可泛化。严格遵守 JSON 输出契约机器可读输出失败时记录原始结果并转人工不要静默修复。用 fixture 校准判断approved-harness-source.json 与 rejected-generic-source.json 分别对应高分但需人工复核与四门全败两种典型走向可作为新评估的对照基准。总而言之Content Curation Rubric 把这篇内容值不值得沉淀成 Agent Skill这一主观判断重构成了一条由硬门控、加权评分、阈值裁决、覆盖规则、证据要求与机器可读输出共同组成的确定性流水线。它既能在自主研究循环中拦截低质输入又能保护高价值但证据不足的来源不被误杀——这正是 researcher/llm-as-a-judge.md 所倡导的以 LLM 为裁判思路在工程落地时的完整形态。【免费下载链接】Agent-Skills-for-Context-EngineeringA comprehensive collection of Agent Skills for context engineering, multi-agent architectures, and production agent systems. Use when building, optimizing, or debugging agent systems that require effective context management.项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-Skills-for-Context-Engineering创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表