
GBrain Ingest 技能深度解析路由式内容摄取管线与大脑写入契约【免费下载链接】gbrainGarrys Opinionated OpenClaw/Hermes Agent Brain项目地址: https://gitcode.com/gh_mirrors/gb/gbrain导读本文围绕 gbrain 仓库中的 ingest 技能 展开完整拆解这条“识别输入类型 → 委派给专门摄取技能 → 以统一契约写入大脑”的内容摄取管线。你会掌握它的六阶段摄取流程、强制引用规范、每条消息的实体检测协议、六类媒体工作流以及gbrain files upload-raw原始源保存的尺寸路由机制同时了解它与 idea-ingest、media-ingest、meeting-ingestion、signal-detector、enrich 等技能如何通过 技能路由调度器 协同链式工作。一、技能定位一条路由而非一个孤立的实现ingest在技能体系中的定位非常特殊它是一个路由router技能。其 frontmatter 开宗明义地写道Route content to specialized ingestion skills. Detects input type and delegates.将内容路由到专门的摄取技能检测输入类型并委派。Frontmatter 字段值说明nameingest技能唯一标识description检测输入类型并委派给专门摄取技能决定何时触发triggersingest this、save this to brain、process this meeting与入站消息匹配的路由信号toolssearch、get_page、put_page、add_link、add_timeline_entry、sync_brain声明的读写工具面mutatingtrue该技能会写入大脑writes_pagestrue会创建/更新页面writes_topeople/、companies/、concepts/、meetings/、sources/允许写入的目录值得注意虽然triggers中的process this meeting会命中本技能但 技能路由调度器 RESOLVER.md 明确给出了消歧规则——“优先选择最具体的技能meeting-ingestion 优先于 ingest”。因此ingest的真正职责是兜底与分流当入站内容是通用性“摄取”请求时它先识别输入形态再决定把工作委派给 idea-ingest链接/文章/推文/想法、media-ingest视频/音频/PDF/书籍/截图/仓库还是 meeting-ingestion会议转录。同时ingest本身也承载了一套完整的通用摄取契约——无论工作最终委派给谁以下六条规则对所有写大脑的操作都生效这也是本文要讲透的主体。二、摄取契约写入大脑的六条铁律技能文档在## Contract一节定义了每次摄取必须保证的六件事内联引用写入大脑页面的每一个事实都必须携带行内[Source: ...]引用注明日期与来源provenance。Iron Law 回链每一个实体提及都会在该实体页面与被提及页面之间创建回链。原始源保留原始素材通过gbrain files upload-raw保存并自动进行尺寸路由小文件进 git大文件/媒体进云存储。State 重写状态State段落以当前最佳理解重写绝不追加——追加式 State 会越来越陈旧、自相矛盾。实体检测每一条入站消息都会触发实体检测值得记录的实体获得页面或更新。回链是双向的提及某个人/公司的新页面必须同时让该实体的页面回链到新页面——“一个未链接的提及就是一个损坏的大脑An unlinked mention is a broken brain”。回链的标准格式定义在 大脑归档规则 与 质量约定 中为- **YYYY-MM-DD** | Referenced in page title -- brief context三、强制引用规范六种来源格式无论输入是用户口述、会议记录、邮件、网页、社交媒体还是综合产出每个写入的事实都必须带内联引用。技能文档给出了六种标准格式来源类型引用格式用户陈述[Source: User, {context}, YYYY-MM-DD]会议数据[Source: Meeting {title}, YYYY-MM-DD]邮件/消息[Source: email from {name} re: {subject}, YYYY-MM-DD]网页内容[Source: {publication}, {URL}, YYYY-MM-DD]社交媒体Source: X/handle, YYYY-MM-DD必须附带链接综合产出[Source: compiled from {sources}]补充细节来自 质量约定 skills/conventions/quality.md来源优先级从高到低为用户直接陈述 大脑既有综合理解compiled truth 时间线原始证据 外部来源当来源冲突时必须把矛盾本身和两条引用都记录下来不能默默二选一。四、六阶段摄取流程ingest的通用流程由六个阶段构成任何内容类型最终都会归约到这条管线解析源Parse the source从输入中提取人、公司、日期与事件。逐个实体处理For each entity mentioned读取 gbrain 中该实体的页面确认是否存在已存在更新 compiled_truth重写 State 段落不追加不存在先过重要性门槛notability gate再按正确类型与 slug 存入 gbrain。追加时间线Append to timeline为每个事件在 gbrain 中添加时间线条目包含日期、摘要与来源引用。创建交叉引用Create cross-reference links为每一对同时被提及的实体建立关联使用恰当的关联类型。回链全部实体Back-link all entities更新每个被提及实体页面回链到本页面Iron Law。时间线合并Timeline merge同一事件出现在所有被提及实体的时间线上——如果 Alice 在 Acme Corp 见到了 Bob这个事件要同时出现在 Alice 页、Bob 页和 Acme Corp 页。第 6 步“时间线合并”是整个摄取管线最具特色的设计它保证了知识图谱没有“孤岛事件”任何一条事件都能从任一相关实体入口触达。五、每条消息的实体检测让大脑随时间复利增长技能文档强调生产环境中的 Agent 应对每一条入站消息都进行实体提及检测——这是让大脑随时间复利增长的信号检测回路signal detection loop。5.1 检测协议扫描消息中的人、公司、概念、原创思考等实体提及每条消息都触发纯运维类消息除外。对每个检出的实体gbrain search name—— 该实体是否已有页面已有用gbrain get slug加载上下文用 compiled truth 辅助应答若消息包含新信息则更新页面。没有对照重要性门槛评估见 归档规则值得跟踪则用gbrain put type/slug新建页面并填充已知信息。创建/更新页面后同步大脑gbrain sync --no-pull --no-embed不阻塞对话实体检测与丰富应紧随应答进行而不是在应答之前——用户不应等待大脑写入才能获得回答。5.2 什么算“值得记录”用户与之互动或讨论的人而非随机提及与用户工作或兴趣相关的公司用户引用或创造的概念/框架用户自己的原创思考想法、论点、观察——价值最高。完整的重要性门槛定义在 skills/_brain-filing-rules.mdWhen in doubt, DONT create.拿不准就不要建——缺失的页面以后可以补垃圾页面却会浪费注意力并拉低检索质量。5.3 捕捉用户原创思考精确措辞即洞见文档给出了一个反直觉但极其重要的指令捕捉原文措辞——用户的语言本身就是洞见不要转述。需要捕获的原创思考包括新颖的观察或论点、框架/心智模型/启发式方法、别人看不到的思想联系、带推理的反主流立场、对外部刺激的强烈反应是什么触发了它、为什么。六、六类媒体工作流分论ingest按“按主要主题归档而非按格式归档”的总原则为六类输入定义了专门工作流。6.1 文章与网页内容输入用户分享的 URL或对话中提到的一篇文章。流程抓取内容web_fetch或等价工具→ 提取标题/作者/出版物/日期/全文 → 写出执行摘要 关键论点不是复述→ 提取实体 → 保存原始源 →面向用户分析不要只做摘要要结合对用户的了解指出有趣之处、连接、矛盾与内容机会。归档位置关于人 →people/关于公司 →companies/可复用框架 →concepts/原始数据 →sources/。6.2 视频与播客输入URLYouTube、播客等或本地音视频文件。流程获取转录尽量做说话人分离如 Diarize.io 提供说话人标签 词级时间戳→保存原始转录JSON 与人类可读 TXT 双份→ 分析执行摘要、关键观点、带说话人归属的关键引语、值得注意的故事/轶事、提及的人与公司→ 提取并交叉引用全部实体。HARD RULE每个视频/播客大脑页面必须链接到原始分离转录——没有转录链接的页面是不完整的。归档位置media/videos/或media/podcasts/并向所有实体回链。质量线有吸引力的标题不是 “This video discusses...”、让人想看的执行摘要、真正的洞见而非主题标签、带真实说话人姓名的逐字引语不是 speaker_0、全部实体带上下文并回链。6.3 PDF 与文档输入文件路径或 URL。流程提取文本扫描版/图片 PDF 走 OCR→ 保存原始源 → 摘要执行摘要 关键章节 值得注意的数据→ 提取实体 → 从实体页面交叉引用。归档位置按归档规则按主要主题归档不按格式。6.4 截图与图片流程分析内容文字密集型图片用 OCR照片做描述→ 若是推文截图提取文本/作者/日期路由到社交媒体工作流若是文章截图提取文本路由到文章工作流若是数据/图表提取数据点描述发现。归档位置取决于内容路由到上述对应工作流。6.5 会议转录输入会议录制服务的转录或手写笔记。流程拉取完整转录转录才是事实来源——AI 摘要信任度中等偏低→ 保存原始转录 → 撰写会议页面你的分析在上、原始转录在下→实体传播MANDATORY对每个与会者与被讨论的公司更新其 State 段落如有新信息、向其时间线追加指向会议页面的条目、若其人/公司重要且尚无页面则创建页面。硬性标准所有实体页面更新完成之前一场会议不算摄取完成。归档位置meetings/YYYY-MM-DD-short-description.md。好会议页面的特征揭示真正的核心矛盾而非条目倾倒、连接既有大脑页面人/公司/交易、标出变化状态、决定、新信息、点名张力或未说出口的话、捕捉真实动态而非表演式总结。6.6 社交媒体内容输入推文、帖子串或社媒帖子。流程抓取完整内容帖子串、引推、上下文→ 含图则用视觉模型 OCR 提取全文 → 摘要说了什么、为什么重要、涉及谁→ 提取实体并更新大脑页面 →必须包含指向原帖的直接链接引用强制要求。归档位置media/x/用于日常聚合若帖子主要关于某个人/公司则归档到实体专属目录。七、原始源保存upload-raw与尺寸路由每个摄取条目都必须保留原始源以支撑可追溯性provenance。文档指定使用gbrain files upload-raw并依赖其自动尺寸路由gbrain files upload-raw file --page page-slug --type type路由规则与 skills/_brain-filing-rules.md 一致文件特征保存位置 100 MB的文本/PDF留在 git 大脑仓库的.raw/sidecar 目录中 100 MB或媒体视频/音频/图片通过TUS 可续传上传6 MB 分块带重试上传到云存储仓库中留下.redirect.yaml指针.redirect.yaml指针格式target: supabase://brain-files/page-slug/filename.mp4 bucket: brain-files storage_path: page-slug/filename.mp4 size: 524288000 size_human: 500 MB hash: sha256:abc123... mime: video/mp4 uploaded: 2026-04-11T... type: transcript访问与恢复命令gbrain files signed-url storage-path—— 生成 1 小时有效的签名 URL 用于查看/分享gbrain files restore dir—— 从云存储下载回本地。另外put_raw_data用于在 gbrain 中保存原始 API 响应与元数据JSON而非二进制。在 enrich 技能 的第 5 步中可以看到这一机制的典型用法原始 API 响应被存为带source、fetched_at、query、data字段的 JSON——如果 compiled truth 日后被质疑原始数据能精确还原 API 当时返回了什么。八、批量前测试先 3-5 条再谈批量技能文档为批量处理批量视频摄取、批量会议处理等设定了强制的质量闸门先用 3-5 条测试。有测试模式则跑测试模式。读实际输出。质量好吗标题有吸引力吗不是 This video discusses...实体提取并回链了吗格式干净吗在方法/技能层面修复问题而不是打一次性补丁。然后才批量执行节流、每 5-10 条提交一次提交。文档给出的成本论证是点睛之笔先测 3 条的边际成本接近于零而清理 100 个坏页面的成本巨大。这一点在 test-before-bulk 约定 中被系统化为“渐进式批量Progressive Ramp”10 → 100 → 500 → 全量四轮推进每轮必须做输出存在性验证count-before/count-after、随机抽检质量、错误率必须低于 2%并且优先使用 gbrain 原生机制--pace节流、--progress-json进度、--dry-run预演而不是手写脚本。该约定还警告了“静默零输出”这种最危险的失败模式脚本退出码 0、钱花了、数据库一行没写。九、质量规则、输出格式与反模式9.1 质量规则清单执行摘要必须更新到 compiled_truth不只是追加时间线State 段落是重写的不是追加的——只保留当前最佳理解时间线条目逆时间序最新在前每个被提及的重要人物/公司都获得页面符合归档规则的前提下关联类型包括knows、works_at、invested_in、founded、met_at、discussed每条时间线条目都带[Source: ...]引用每个实体提及都创建回链Iron Law按主要主题归档不按格式或来源。9.2 输出格式每次摄取完成后的回报模板INGESTED: [title] Page: [slug] Type: [person / company / meeting / media / concept] Source: [source description] Entities detected: N - [entity] - [created / updated] ([slug]) Back-links created: N Timeline entries: N Raw source: [preserved at path / uploaded to cloud]9.3 反模式五条逐条对应契约反模式后果向 State 段落追加而非重写State 越来越陈旧、自相矛盾摄取时跳过回链未链接的提及 损坏的大脑跳过原始源保存无 provenance 的页面无法验证未抽样就批量处理100 个坏页面比 3 条测试贵得多转述用户原创思考用户精确语言就是洞见必须逐字捕捉十、委派链与配套技能路由如何落地ingest的路由能力在 技能路由调度器 RESOLVER.md 的“内容与媒体摄取Content media ingestion”表格中完整呈现触发信号委派目标用户分享链接/文章/推文/想法idea-ingestwatch this video、process this YouTube link、ingest this PDF 等media-ingest收到会议转录meeting-ingestion通用 ingest this自动路由到上述技能ingest本文主体各子技能在本文主体契约之上补充了更细的要求值得在真实使用中配合阅读idea-ingest强制为作者创建 people 页面“任何思考值得摄取的人都值得追踪”面向用户的应答必须把内容连接到大脑已知信息——活跃项目是否相关、是否与既有知识矛盾、是否涉及已知人/公司禁止臆造连接只引用经 search/query 验证过的连接不要创建concepts/strategy这类泛化 slug要具体到concepts/flywheel-effects。media-ingest定义了source必填/title/target_slug可选三个输入参数与五阶段流程并给出了标准页面模板Summary / Key Segments / People Mentioned / Companies Mentioned错误处理上明确“转录失败不伪造内容标注[transcript unavailable]后继续”已知陷阱包括 YouTube 自动字幕误认专有名词、重复摄取产生重复页、书籍 OCR 质量参差、无说话人分离的转录价值低、超过 2 小时的音频可能超时需切分。meeting-ingestion把会议摄取升级为“统一管线”——先归一化为标准转录记录source/source_id/title/date/attendees/transcript_segments/raw_transcript_text/source_summary 等字段再做多会议录制拆分、跨录制去重、基于证据的说话人解析并且每条令人意外的声明都必须通过一致性检查转录证据 大脑矛盾检查 逻辑合理性后才能写入实体页面最终以 V1–V6 验证清单收尾其中 V6 序列验证PHASE_INVERSION / TELEPORT是独立于内容的顺序检查硬性矛盾会 BLOCK 整场会议的“已摄取”声明。signal-detector把“每条消息检测实体与原创思考”做成显式的环境捕获技能——默认关闭必须显式 opt-in捕获用户想法时保留精确措辞信号日志Signals: 1 idea (captured → originals/x), 2 entities (enriched → people/y, companies/z)让环境捕获回路可调试。enrich实体页面创建/更新的三层级协议Tier 1 关键人物全管线 / Tier 2 值得注意适度 / Tier 3 次要轻量七步协议识别实体 → 检查大脑状态 → 提取信号 → 外部查找 → 保存原始数据 → 写入大脑 → 交叉引用并给出 person/company 两套完整页面模板。十一、支撑整个管线的四条跨切约定ingest及其委派技能都引用了同一组跨切约定理解它们才能真正用好这条管线大脑归档规则 skills/_brain-filing-rules.md主主题决定归档位置不是格式、来源或正在运行的技能给出了常见错档模式对照表对人物的分析放进sources/、会议衍生的公司信息只放meetings/等都是错误sources/只用于批量数据导入、喂给多个页面的原始数据与周期性快照合成产物的media/format/slug例外仅限“单一来源 单一读者”的个性化产出如 book-mirror。质量约定 skills/conventions/quality.md引用格式、来源优先级、Iron Law 回链格式与重要性门槛的权威定义。brain-first 约定查找链强制顺序——精确已知词条先search廉价混合检索概念/全景问题先query带 LLM 扩展的多查询找到 slug 后get_page读完整 compiled truth外部 API 只在 1-2 步无果之后才动用Score 0.5 use it写入后触发gbrain sync --no-pull。从源码结构看这一约定的存在价值在于brain 有数千页面答案几乎总在里面。brain 路由约定区分两个正交轴——Brain哪个数据库--brain/GBRAIN_BRAIN_ID/.gbrain-mount与 Source库内哪个仓库--source/GBRAIN_SOURCE/.gbrain-source跨大脑查询不做确定性联邦v0.19 是 Agent 驱动的潜在空间联邦每条结论必须可追溯到brain:source:slug写操作比读更严格跨脑写入前先询问用户。十二、工具面一览ingest声明的工具集合贯穿整个流程与 brain-first 约定 中的工具表一一对应工具用途search/query检查实体页面是否存在词条/概念两种检索模式get_page已知 slug 时读取页面put_page创建或更新大脑页面auto-link 后置钩子会自动建链add_link为实体对建立关联边add_timeline_entry添加带日期的事件时间线条目仍需显式调用get_tags/add_tag页面标签管理put_raw_data保存原始 API 响应与元数据JSONget_backlinks检查谁引用了该实体sync_brain/gbrain sync写入后同步索引使新页面可检索结语ingest是 gbrain 内容摄取体系的总入口它本身承担“识别输入类型并委派”的路由职责同时定义了贯穿所有子技能的统一契约——内联引用、Iron Law 回链、原始源保存、State 重写、时间线合并与逐条消息的实体检测。把它与 idea-ingest、media-ingest、meeting-ingestion 的委派链以及 归档规则、质量约定、brain-first、brain 路由 等支撑约定组合起来就是一套从“任意内容输入”到“结构良好、可追溯、随时间复利增长的知识图谱”的完整生产管线。【免费下载链接】gbrainGarrys Opinionated OpenClaw/Hermes Agent Brain项目地址: https://gitcode.com/gh_mirrors/gb/gbrain创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考