尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

如何用 LightRAG 快速搭建知识图谱检索增强生成系统

如何用 LightRAG 快速搭建知识图谱检索增强生成系统 如何用 LightRAG 快速搭建知识图谱检索增强生成系统【免费下载链接】LightRAG[EMNLP2025] LightRAG: Simple and Fast Retrieval-Augmented Generation项目地址: https://gitcode.com/GitHub_Trending/li/LightRAGLightRAG 是一个轻量级的知识图谱 RAG检索增强生成框架文档导入后自动提取实体与关系建成知识图谱再用双层次检索回答问题。适合有一点 Python 基础、想先验证这套知识问答能不能跑通再谈生产化的开发者。什么情况下你需要 LightRAG先对号入座三种场景命中任意一条这个框架就是为你准备的。内部技术文档、手册、规范堆在仓库里同事反复问同样的问题你想给它一个问答入口但不想自己从零搭索引和排序链路。问题跨文档比如某组件为什么频繁告警需要同时引用三篇文档的信息纯按文本块检索的传统 RAG 容易只命中其中一篇。你有一批 PDF、Word、Markdown 格式的混合文档希望多格式统一入库并且答案能回溯到原文出处。想先用小样本验证知识库的问答质量再决定生产环境选哪种存储后端。十分钟跑通 LightRAG这一节跟着敲四条命令你就能在本地看到第一次查询结果。环境要求只有两条Python 3.10 及以上项目pyproject.toml中声明的最低版本一个可用的 LLM 与 Embedding 模型 API。无需 GPU。第一步安装。从 PyPI 装服务端含 API 与 WebUI 依赖pip install lightrag-hku[api]第二步最小配置。配置已经从config.ini迁移到.env文件仓库根目录的config.ini.example顶部已注明该格式将逐步移除cp env.example .env # 编辑 .env填入 LLM 与 Embedding 模型配置env.example 内每项均有注释说明 lightrag-server第三步验证。服务默认监听 9621 端口确认存活curl http://localhost:9621/health打开浏览器访问http://localhost:9621WebUI 会出现 Documents、Knowledge Graph、Retrieval、API 四个标签页。至此你的第一套知识图谱 RAG 服务已经在运行了 原理速览一张图看懂双层次检索这一节只回答一个问题文档进去之后发生了什么它和普通 RAG 差在哪。打个比方普通 RAG 像图书馆的关键词搜索框输入几个词返回几个相关段落段落之间互不相识。LightRAG 则先请一位馆员通读每篇文档登记索引卡——卡上写实体人、系统、概念和实体间的关系——形成一张知识图谱。你提问时它先查索引卡找到相关的实体与概念图层次检索再回原文库把对应的文本段落取出来向量层次检索最后把两层证据一起交给 LLM 组织答案。这就是双层次的含义上层走知识图谱擅长跨文档的宏观关联下层走向量库擅长精确命中具体事实。查询时默认使用mix模式合并 local局部实体、global全局关系与 naive纯向量块三路结果另有local、global、hybrid、naive四种模式可按需切换。把它接进真实业务搭建文档问答知识库这一节按动手路线走一遍企业知识库场景不堆功能清单。你先做 A把待入库文档放进INPUT_DIR目录默认./inputs可在.env修改或在 WebUI 的 Documents 页直接点击 Upload 上传支持 PDF、Word、Markdown 等格式。再做 B触发文档处理WebUI 的 Scan 按钮在列表里等待状态变为 Completed。处理时系统会自动完成解析、分块、实体关系抽取三步。用 C 验证在 Retrieval 标签页提一个跨文档问题检查答案与引用的原文再切到 Knowledge Graph 标签页确认实体之间的连线符合你的领域预期。如果验证通过再考虑批量导入与权限控制如果答案质量不达标先回头调分块策略和 LLM 角色配置而不是急着换存储。上生产之前本地、Docker、Kubernetes 怎么选这一节只回答选型问题三种形态各适合谁第一步分别做什么。本地个人验证用。pip install加lightrag-server即可默认使用文件持久化的内存数据库文档少、单机、无并发时体验最好但不适合生产。Docker团队共用的单机部署。cp env.example .env docker compose up数据落在./data/rag_storage服务监听 9621 端口。注意在.env中配置认证如LIGHTRAG_API_KEY否则所有接口对外公开。Kubernetes生产环境多副本部署。仓库提供 Helm Chart见 K8s 部署配置运行 install_lightrag.sh 一键安装配套数据库组件在k8s-deploy/databases/下。存储后端按此原则选开发用默认文件存储生产想要单一后端托管全部四类存储KV、向量、图谱、文档状态选 PostgreSQL、MongoDB 或 OpenSearch想要组合拳则向量用 Milvus/Qdrant、图谱用 Neo4j/Memgraph。进阶与避坑六个参数和评估手段分块策略支持 Fixed、Recursive、Vector、Paragraph 四种中文长文档建议用 Paragraph 语义分块块边界对齐标题与段落减少标题和正文分家。Embedding 模型定了就不能换更换后所有文本块、实体、关系都要重建且没有现成的重嵌工具PostgreSQL 后端还需删掉向量表重建选型前先想清楚。LLM 缓存KV 存储会缓存实体抽取等 LLM 响应重复文档不会重算修改了提示词后需用 clean_llm_query_cache.py 清缓存否则看到旧结果会误判。并发调优大批量入库时调整MAX_ASYNC_LLM、MAX_PARALLEL_INSERT约为前者的 1/3、EMBEDDING_BATCH_NUM变量说明见env.example。Rerank 取舍开启后查询质量明显提升但每次多 1–2 秒延迟在意响应时间的场景建议把重排模型部署到本地。质量要量化仓库内置 RAGAS 评估见 评估说明关注忠实度、答案相关性、上下文召回与精度四项经验阈值 0.8 以上。接下来你可以做的三件事 ⚙️跑一遍官方示例看完整的初始化、插入、查询代码长什么样examples/lightrag_openai_demo.py。通读 docs/ 里的 API Server 与文件处理管线文档把前面先做 A 再做 B的流程替换成你自己的文档源。浏览 lightrag_webui/ 了解界面能力或直接对照 K8s 部署配置 规划生产拓扑。挑一件今天就动手你的第一张知识图谱离得很近 ✨【免费下载链接】LightRAG[EMNLP2025] LightRAG: Simple and Fast Retrieval-Augmented Generation项目地址: https://gitcode.com/GitHub_Trending/li/LightRAG创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表