尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

RAG-Anything 文档解析器怎么选:MinerU、Docling 与 PaddleOCR 的适用场景与安装要求

RAG-Anything 文档解析器怎么选:MinerU、Docling 与 PaddleOCR 的适用场景与安装要求 RAG-Anything 文档解析器怎么选MinerU、Docling 与 PaddleOCR 的适用场景与安装要求【免费下载链接】RAG-AnythingRAG-Anything: All-in-One RAG Framework项目地址: https://gitcode.com/GitHub_Trending/ra/RAG-AnythingRAG-Anything 在解析文档时默认调用的是哪个解析器、需要装哪些依赖是首次使用时最容易卡住的环节。它内置 MinerU、Docling、PaddleOCR 三个解析器三者支持的输入格式和依赖安装方式并不相同MinerU 随基础安装一起提供Docling 和 PaddleOCR 需要额外安装依赖。本文按“按文件类型选解析器 → 安装对应依赖 → 配置并验证”的顺序给出每个环节的真实命令和判断方式。按文件格式选解析器README 的 “Parser Configuration” 一节对三个解析器的定位描述如下解析器README 给出的适用场景支持的文件格式来自源码额外安装要求MinerUPDF、图片、Office 文档等OCR 与表格提取能力强支持 GPU 加速PDF图片原生.png/.jpeg/.jpg其余格式经 Pillow 转 PNGOffice先转 PDF文本先转 PDF基础安装已含mineru[core]Docling针对 Office 文档和 HTML 文件优化文档结构保留更好原生支持多种 Office 格式PDF、Office 六种格式、HTML.html/.htm/.xhtml传入图片、文本等其他格式会抛出 “Unsupported file format”pip install doclingPaddleOCR面向图片和 PDF 的 OCR 解析器产出与现有content_list流程兼容的文本块Office/TXT/MD 可选支持先转 PDFPDF逐页渲染后 OCR、图片Office 需 LibreOffice 先转 PDFTXT/MD 需 ReportLab 转 PDFraganything[paddleocr]额外依赖 平台对应的paddlepaddle选型时直接按输入文件类型对号即可以扫描件、纯图片为主选 MinerU 或 PaddleOCR以 Office 和 HTML 为主且在意结构保留时选 Docling需要 OCR 聚焦的扫描件 PDF 并复用content_list文本块时用 PaddleOCR。注意 PaddleOCR 解析 PDF 时会把每页渲染成图像再 OCR输出是{type: text, ...}文本块这一点与 MinerU/Docling 的结构化输出不同见 raganything/parser.py。安装 RAG-Anything 与解析器依赖从 PyPI 安装基础包requirements.txt中基础依赖已包含mineru[core]即 MinerU 解析器开箱可用pip install raganything如需扩展格式支持README 列出的可选 extrapip install raganything[image] # BMP、TIFF、GIF、WebP 图像格式转换依赖 Pillow pip install raganything[text] # TXT、MD 处理依赖 ReportLab pip install raganything[all] # 全部可选 Python 依赖从源码安装时用uv sync加对应 extra例如uv sync --extra paddleocr。各解析器的依赖安装要求MinerU。基础安装已含若单独补装源码中给出的命令是pip install -U mineru[core]或uv pip install -U mineru[core]。Doclingpip install doclingPaddleOCR。先装 extraPyPI 方式或源码方式二选一pip install raganything[paddleocr] # 或源码安装 pip install -e .[paddleocr] # 或 uv uv sync --extra paddleocr该 extra 在 setup.py 中定义为paddleocr2.7.0和pypdfium24.25.0。README 同时强调PaddleOCR 还需要paddlepaddleCPU/GPU 包因平台而异按 PaddlePaddle 官方安装指南paddlepaddle.org.cn选择对应平台的包安装。处理 Office 文档的公共前提MinerU 2.0 不再内置 Office 文档转换Office 文件.doc、.docx、.ppt、.pptx、.xls、.xlsx依赖 LibreOffice 先转成 PDF。各平台安装方式README 原文Windows从 LibreOffice 官网下载安装macOSbrew install --cask libreofficeUbuntu/Debiansudo apt-get install libreoffice需要 sudo 权限CentOS/RHELsudo yum install libreoffice配置解析器解析器通过parser参数选择取值mineru、docling或paddleocr有三种配置入口配置RAGAnythingConfig或调用解析方法时传参await rag.process_document_complete( file_pathdocument.pdf, output_dir./output/, parse_methodauto, # 解析方法auto、ocr、txt parsermineru, # 可选mineru、docling、paddleocr )用环境变量 env.example 中的PARSER默认mineruPARSERmineru # 可选值mineru、docling、paddleocr PARSE_METHODauto运行示例脚本时用--parser参数examples/raganything_example.py 中该参数默认取环境变量PARSER未设置时为minerupython examples/raganything_example.py path/to/document.pdf --api-key YOUR_API_KEY --parser mineru其中path/to/document.pdf换成你的文档路径YOUR_API_KEY换成你的 LLM API key。验证解析器安装RAG-Anything 在处理文档前会调用check_installation()做预检三个解析器的检查口径不同见 raganything/parser.pyMinerU探测mineruCLI 可执行Docling探测docling.document_converter.DocumentConverter可导入不再探测 CLI 是否在 PATH 上PaddleOCR探测paddleocr包可导入验证命令README 原文# 验证 MinerU mineru --version # 检查当前配置的解析器是否装好 python -c from raganything import RAGAnything; rag RAGAnything(); print(✅ MinerU installed properly if rag.check_parser_installation() else ❌ MinerU installation issue)若解析器未安装check_installation()返回FalseRAGAnything初始化时会记录 “Parser ... is not properly installed. Please install it using pip install or uv pip install.” 并返回失败此时回到上一步补齐对应依赖。解析一份真实文档确认输出安装验证通过后用一份真实文档跑一次解析确认链路完整。示例脚本python examples/raganything_example.py path/to/document.pdf --api-key YOUR_API_KEY --parser mineruMinerU 还有三个不需要 API key 的测试脚本只测解析功能examples/office_document_test.pyOffice 文档、examples/image_format_test.py图像格式、examples/text_format_test.py文本格式均基于 MinerU。各解析器的产物位置用于核对是否成功MinerU在输出目录下生成{文件名}.md和{文件名}_content_list.json通常在{文件名}/auto等子目录内首次使用时模型自动下载DoclingJSON 与 Markdown 写入output_dir/file_stem/docling/PaddleOCR返回由{type: text, text: ..., page_idx: ...}组成的内容块列表已知限制与常见报错MinerU 2.0 相关Office 文档必须先转 PDF依赖 LibreOffice不再使用magic-pdf.json配置文件全部设置改为命令行参数或函数参数。常用命令行配置README 原文mineru --help mineru -p input.pdf -o output_dir -m auto # 自动解析模式 mineru -p input.pdf -o output_dir -m ocr # OCR 重点解析 mineru -p input.pdf -o output_dir -b pipeline --device cuda # GPU 加速MinerU 卡住超时的提示源码中超时错误信息为 “MinerU did not finish within {timeout}s. This often means a model download is stuck due to network issues.”即大概率是首次模型下载被网络卡住应检查网络或预先下载所需模型。Docling 不支持图片与文本文件parse_document对 PDF/Office/HTML 之外的扩展名直接抛出 “Unsupported file format”不要用 Docling 解析扫描件图片。PaddleOCR 缺依赖缺paddleocr或pypdfium2时分别报 ImportError按上文 extra 方式安装paddlepaddle未装或平台不匹配时初始化会失败。模型下载MinerU 的模型首次使用时自动下载需要手动下载时参考 MinerU 官方文档的 “Model Source Configuration” 一节。【免费下载链接】RAG-AnythingRAG-Anything: All-in-One RAG Framework项目地址: https://gitcode.com/GitHub_Trending/ra/RAG-Anything创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表