尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

如何让AI Agent像人一样读文档?Knowhere Agentic Retrieval与MCP工具完整指南

如何让AI Agent像人一样读文档?Knowhere Agentic Retrieval与MCP工具完整指南 如何让AI Agent像人一样读文档Knowhere Agentic Retrieval与MCP工具完整指南【免费下载链接】knowhereKnowhere extracts, parses, and outputs structured chunks ready for AI Agents and RAG.项目地址: https://gitcode.com/gh_mirrors/know/knowhereKnowhere 是一个开源的文档解析与检索系统能把 PDF、PPT、Word、Excel 等脏文件解析成 AI Agent 可直接导航的持久化文档记忆。本文将带你完整了解它的核心能力Agentic Retrieval智能体式检索为什么 Agent 读文档应该像人一样先翻目录、再定位、后精读以及它内置的MCP 工具如何让你的 AgentCursor、Claude 等直接接入这份文档记忆并返回可溯源到页码的证据。一、传统 RAG 的痛点Agent 在搜索而不是在阅读 传统 RAG 做的是扁平的向量查找把一个几十页的 PDF 切成碎片、做向量检索、返回几个孤立的段落。Agent 拿到的碎片缺少上下文既不知道这段来自哪一章也不知道文档的整体结构。Knowhere 的思路完全不同——它先为文档构建一棵可导航的层级树Namespace命名空间→ Document文档→ Section章节→ Chunk检索单元每个章节都保留完整的文档路径、页码范围、摘要、实体和关联的图片/表格Agent 可以像人一样先看目录 → 判断哪一章相关 → 精读该章 → 顺藤摸瓜引用图表官方基准测试显示基于 Knowhere 记忆的 Agent 比直接读取原始文档或 Markitdown、Unstructured、MinerU 输出的 Agent首次回答准确率提升 36%、召回率提升 11%且有反馈时准确率可达 79%。更少的循环、更少的 token、更短的时间。二、双轨解析先给 Agent 一份读得懂的记忆 Knowhere 2.0 采用**视觉轨Vision Track 文本轨Text Track**双轨解析文本轨对 DOCX、XLSX、MD 等文本原生文档保留精确的标题层级和原生结构视觉轨对复杂 PDF 和 PPT直接用前沿视觉模型整页看懂不依赖脆弱的逐元素 OCR两条轨道最终汇聚到同一套记忆 schema下游的检索引擎和引用模型无需关心文档原始格式。这套面向 Agent 的语料 schema是检索的地基其唯一定义在 CORPUS_SCHEMA.md 中设计说明见 docs/design/agent-corpus-schema.md。三、Agentic RetrievalAgent 读文档的完整工作流 这是整个项目的灵魂。Knowhere 不强制 Agent 走固定的检索流水线而是提供一套层级感知的探索工具由 Agent 自己决定调用哪些工具、按什么顺序、钻多深9 个 corpus.* 工具速查表工具什么时候用人话版list_documents用户明确想盘点语料库我有哪些文档outline只需要标题和摘要翻目录node_filter对章节标题/摘要做遍历判断哪些章节的标题提到了 Xgrep已知精确字符串、编号、数字全文搜索这个关键词recall模糊问题不知道答案在哪帮我找找感觉read已确定要读哪一节精读这一节全文query_table表格太大只要特定单元格只给我这张表的第 3 行assets要图片/表格或反查图表属于哪节这图出现在哪里neighbors找同命名空间的相关文档还有哪些文档和它相关典型检索路径一次自然的人类式阅读流程大致是outline看目录圈定候选章节grep已知精确词或recall模糊问题定位read精读正文——它会自动解析跨页引用、展开关联的图表遇到大表格用query_table做只读 SQL 查询顺带用neighbors找相关文档交叉验证每一步返回的结果都携带可溯源引用文档 ID、章节路径、页码以及渲染好的页面截图作为视觉证据。四、MCP 工具接入三步让你的 Agent 读文档 Knowhere API 内置了一个MCPModel Context Protocol服务端点挂载在/mcp路径上无状态 HTTP 传输任何支持 MCP 的客户端都可以直接接入。实现见 apps/api/app/mcp/retrieval_server.py。接入步骤第 1 步启动 Knowhere 本地服务# 克隆仓库 git clone https://gitcode.com/gh_mirrors/know/knowhere cd knowhere # 安装依赖并启动本地基础设施PostgreSQL / Redis / LocalStack uv sync --all-packages ./deploy/local-dev/start-dev.sh # 分别启动 API 和 Worker cd apps/api uv run main.py cd apps/worker uv run worker.py第 2 步创建 API 用户与密钥cd apps/api uv run scripts/init_user.py --email youexample.com第 3 步在 MCP 客户端中配置在你的 MCP 客户端如 Cursor、Claude Desktop中将端点指向http://localhost:5005/mcp并通过 HTTP 头传递认证信息Authorization: 你的 API 密钥x-knowhere-namespace: 可选指定检索的命名空间多租户隔离用MCP 端点会自动注册两类工具见 apps/api/app/mcp/dynamic_tools.pycorpus.*系列推荐上面表格中的 9 个探索工具schema 与内置 Agent 完全一致retrieval.query一键式兼容检索适合只需要问一句、拿证据的简单场景返回 evidence组合证据、referenced_chunks引用元数据和 decision_trace导航决策轨迹五、给新手的 3 条实用建议 能用grep就别用recall已知精确字符串编号、术语、数字时grep更快更准recall留给真正模糊的问题。先定位、后精读先用outline/node_filter缩小范围再read正文可以大幅节省 token 预算。看引用别只看文字结果里的页码截图和章节路径是可验证的证据回答用户时带上它们可信度会显著提升。六、延伸阅读 检索的文档作用域规则docs/retrieval-document-scope.md架构决策记录ADRdocs/adr/README.md检索设计文档docs/design/想参与贡献从 CONTRIBUTING.md 开始添加新格式解析器是很好的第一个 PR。总结Knowhere 没有再造一个更强的解析器而是构建了一层 Agent 真正能用的文档记忆基础设施——层级化记忆 中立工具契约 MCP 接入。你的 Agent 负责思考怎么找Knowhere 负责保证每一步都可溯源。这正是 AI Agent 像人一样读文档的答案。【免费下载链接】knowhereKnowhere extracts, parses, and outputs structured chunks ready for AI Agents and RAG.项目地址: https://gitcode.com/gh_mirrors/know/knowhere创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表