尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

WeKnora 完整指南:30分钟把文档变成可提问的 RAG 知识库

WeKnora 完整指南:30分钟把文档变成可提问的 RAG 知识库 WeKnora 完整指南30分钟把文档变成可提问的 RAG 知识库【免费下载链接】WeKnoraOpen-source LLM knowledge platform: turn raw documents into a queryable RAG, an autonomous reasoning agent, and a self-maintaining Wiki.项目地址: https://gitcode.com/GitHub_Trending/we/WeKnoraWeKnora 是一个开源的文档问答 RAG 框架RAG 即检索增强生成先从你的资料里捞出相关段落再交给大模型基于这些段落作答而不是让模型凭记忆硬答。它把 PDF、Word、网页等原始文档解析成结构化的知识库支持语义检索、多模态图片理解和自主推理 Agent。适合想给团队文档、产品手册、合同协议搭一个即问即答入口的开发者与普通用户也适合想私有化部署、数据不出内网的企业。 如何用 Docker Compose 两条命令跑起 WeKnora前提只有一台装好 Docker 和 Git 的机器。把仓库拉到本地复制一份环境变量模板拉镜像并启动三步走完git clone https://gitcode.com/GitHub_Trending/we/WeKnora cd WeKnora cp .env.example .env docker compose pull docker compose up -d启动后打开浏览器访问http://localhost首次进入会跳到初始化配置页在这里选对话模型LLM和向量模型Embedding即把文字变成一串数字、让意思相近可以被计算的模型并填好密钥。后端 API 在 8080 端口前端页面上方还能看到知识库、对话与设置等入口。如果你习惯一条命令搞定scripts/start_all.sh 可以自动检查环境、拉起 Ollama 本地模型并管理启停各服务的编排细节都在 docker-compose.yml 里。 一份 PDF 的旅程从上传到被问答链路上每站去哪看代码服务跑起来后把一个 PDF 拖进知识库背后会依次经过四站。第一站解析。后端把文件交给独立的 docreader 服务Python 写的 gRPC 子服务它按文件类型路由到对应解析器逐页提取文字、表格和插图扫描件还会过一遍 OCR。这一步的代码在 docreader/parser/想看某个格式怎么处理直接找同名的xxx_parser.py。第二站切片与向量化。长文被切成小块入库——默认单块 512 字符、相邻块重叠 50 字符参数在 config/config.yaml 的knowledge_base段切分策略本身在 internal/infrastructure/chunker/。随后每个块交给 Embedding 模型转成向量写进向量库。第三站混合检索。你提的问题先被改写、扩展然后同时走关键词BM25和向量两条路召回候选块再用 Rerank 模型重排序取头部。相关阈值与截断数量同样集中在config.yaml的conversation段检索编排逻辑在 internal/application/service/knowledgebase_search.go 一带。第四站模型作答。排好序的块被拼进提示词交给 LLM回答里附可点击的引用点一下能看到答案出自哪个文档的哪一段见 智能问答对话界面 的展示效果。整条链路的总装代码是 knowledge_process.go调试时从它切入最快。 三个高频场景怎么开知识库导入、图片多模态、知识图谱把散落的文档变成可问答的知识库适合谁手上有一堆 PDF、Word、Excel 或网页链接想先让同事能问到的人。怎么开Web UI 里新建知识库→上传文件支持文件夹批量上传保留目录结构或粘贴 URL 导入也可以在上传时通过process_config指定解析引擎与分块方式。想跳过界面直接集成用 API Key 调 RESTful 接口即可请求示例见 client/example.go端点清单在 docs/api/README.md。去哪看细节上传后在知识库详情页能直接看到解析进度和每个分块不满意可在界面上编辑分块并回滚。让模型看懂文档里的图片适合谁资料里有架构图、产品截图、票据照片纯文字解析会丢信息。怎么开在知识库设置的高级设置里打开多模态开关并配置一个视觉语言模型VLM解析时它会给每张图生成描述再入库config.yaml中knowledge_base.image_processing.enable_multimodal控制总开关。图片文件本身需要对象存储兜底——用内置 MinIO 的话加--profile minio启动跨设备看图时还要把MINIO_PUBLIC_ENDPOINT从localhost改成本机实际 IP这点是高频坑。去哪看细节图片入库后的展示与外链规则参见 docs/QA.md 第 4 节。用知识图谱提升长文档的召回适合谁单篇文档很长、问题跨章节比如这个方案里 A 组件和 B 流程什么关系单纯向量检索容易漏。怎么开在.env里设NEO4J_ENABLEtrue并填好连接信息然后用一条命令把图谱库拉起来docker compose --profile neo4j up -d再重启服务到知识库设置里勾选启用实体抽取与启用关系抽取文档入库时就会自动提炼实体和关系存进 Neo4j对话时系统按意图查图谱补充召回。开启步骤与验证方法完整写在 docs/开启知识图谱功能.md抽取用的提示词模板在 config/prompt_templates/graph_extraction.yaml。 踩坑与调优清单三件高频故障各自先查什么服务起不来先看docker compose logs -f app docreader postgres的报错九成是.env里模型相关变量没配全名称、BASE_URL、API_KEY、向量维度对照模板文件逐项补齐。文档传不上、状态一直卡在解析优先怀疑 Embedding 模型配置——模型名、维度INIT_EMBEDDING_MODEL_DIMENSION、访问地址四项必须和模型实际规格一致用 Ollama 时还要确认本地ollama serve在跑。日志里搜ERROR定位。检索不准、答非所问先调 config/config.yaml 里conversation段的召回条数embedding_top_k与 rerank 阈值再检查是否配置了 Rerank 模型块切得太碎会丢上下文可适当调大chunk_size。多模态图片打不开确认 MinIO 已随 profile 启动、bucket 权限为可读、MINIO_PUBLIC_ENDPOINT指向真实可达地址。扫描件文字识别差PaddleOCR 在部分平台不稳可改用外部 VLM 做 OCROCR_BACKENDvlm见 docs/QA.md 第 5 节。 下一步入口文档、示例、数据集与反馈想系统性深入入口在 website-docs/——按入门→架构→功能→API→客户端→开发六个板块组织的官方文档站覆盖约 360 个 API 端点与全部环境变量本地npm run dev即可预览。写代码集成就从 client/ 目录的 Go SDK 和 client/example.go 抄作业想验证自己调优有没有效果dataset/ 里有一套现成的问答评测集查询、语料、标准答案、相关性标注。遇到疑难杂症先把 docs/QA.md 过一遍解决不了的直接到项目 Issue 区描述环境、日志与复现步骤那里也是社区反馈的主要阵地。【免费下载链接】WeKnoraOpen-source LLM knowledge platform: turn raw documents into a queryable RAG, an autonomous reasoning agent, and a self-maintaining Wiki.项目地址: https://gitcode.com/GitHub_Trending/we/WeKnora创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表