尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Docling 文档解析实战:从安装到批量转换 Markdown 的完整路线

Docling 文档解析实战:从安装到批量转换 Markdown 的完整路线 Docling 文档解析实战从安装到批量转换 Markdown 的完整路线【免费下载链接】doclingGet your documents ready for gen AI项目地址: https://gitcode.com/GitHub_Trending/do/doclingDocling 是一个开源文档解析工具把 PDF、Word、HTML、扫描件甚至音频统一转成结构化文档表示为生成式 AI 提供干净的输入。读完本文你能独立装好环境、完成第一次转换并用 CLI 完成批量输出与 OCR 调优。 选型指南先想清楚你的输入长什么样Docling 的解析能力按输入类型分成了三条路线标准管线处理带文本层的 PDF 和办公文档VLM 管线视觉语言模型即让大模型看图读文档处理复杂版面ASR 管线自动语音识别处理音视频。选对路线后面的调参才不会白费。你的场景推荐方案关键命令/配置带文本层的 PDF / DOCX / HTML标准管线默认docling report.pdf复杂版面、公式图表密集VLM 管线docling --pipeline vlm FILE扫描件、纯图片 PDF标准管线 OCRdocling --ocr-mode full_page FILE录音、视频转文字ASR 管线docling --pipeline asr --asr-model whisper_turbo FILE细节可对照官方 安装说明 与 CLI 参考。⚡ 五分钟快速上手docling 一行命令安装环境要求很简单Python 3.10macOS、Linux、Windows 均支持x86_64 与 arm64 都可以。下面是可直接跑通的完整流程。基础安装与验证pip install docling docling --version第一条命令装好核心解析能力第二条能打印版本号就说明 CLI 已经可用。按需补装可选组件基础包不含重依赖需要时再装 extras避免环境臃肿pip install docling[vlm] # VLM 管线依赖 pip install docling[asr] # 音视频转录依赖两个平台特例要留意Intel 版 Mac 上 PyTorch 新版不再提供对应轮子应改用pip install docling[mac_intel]要求 Python 3.12 及以下纯 CPU 的 Linux 机器建议选 PyTorch 的 CPU 构建安装参数可查 PyTorch 官方指南。OCR 引擎怎么挑OCR 即从图片里识别文字扫描件必备。常用引擎RapidOCR装rapidocrextra轻量快速也是默认推荐、EasyOCReasyocrextra多语言通用、Tesseract需系统级安装精度高。引擎安装方式适合场景RapidOCRpip install docling[rapidocr]默认首选轻量Tesseract系统包管理器安装 tesserocrextra高精度需求ocrmacocrmacextra仅 macOS调用苹果 Vision 框架Tesseract 安装后还需设置语言文件路径注意结尾要带斜杠export TESSDATA_PREFIX/usr/share/tesseract/tessdata/ 核心功能走查一次转换得到什么安装完成后用 快速上手 里的最小示例完成第一次转换from docling.document_converter import DocumentConverter source https://arxiv.org/pdf/2408.09869 converter DocumentConverter() doc converter.convert(source).document print(doc.export_to_markdown())几行代码就能把一篇论文 PDF 变成带标题层级的 Markdown。这里的关键不是输出文本而是doc这个统一的文档对象页码、标题、表格、图片的位置和层级关系都被结构化保存下来后续切片、检索、问答都能基于它做而不必再碰原始 PDF。顺手把批量和错误处理做掉真实项目一次都要处理几十份文件。CLI 的 source 参数可以直接传目录用 Python 时则循环遍历即可。raises_on_errorFalse让单份文件失败不中断整批转换状态由result.status给出部分成功也能继续导出from pathlib import Path from docling.document_converter import DocumentConverter converter DocumentConverter() for path in Path(./pdfs).glob(*.pdf): result converter.convert(path, raises_on_errorFalse) if result.status.value ! failed: path.with_suffix(.md).write_text(result.document.export_to_markdown())循环跑完目录里每个 PDF 旁都会多一份.md坏文件被跳过而不影响其他结果。导出时的图片行为也能控制默认图片以 base64 内嵌在输出里用--image-export-mode referenced可改为导出 PNG 文件再引用placeholder则只留位置占位。 进阶技巧按场景用 CLI 参数CLI 参数按使用意图分成几组比背清单好用得多。切换输出格式--to可重复使用一次产出多种格式比如 Markdown 喂给模型、JSON 存档、chunks 直接做 RAG 语料docling --to md --to json --to chunks report.pdf给扫描件开 OCROCR 默认开启但对已有文本层却不可信的扫描文档需要用--ocr-mode full_page强制全文重识别同时可以指定语言不同引擎的语言名不同docling --ocr-mode full_page --ocr-lang en,de scan.pdf只转一部分、省时间长文档不必整本处理--page-range只转指定页--table-mode fast在精度够用前提下提速docling --page-range 1-4 --table-mode fast long_doc.pdf输出 RAG 语料--to chunks配合--chunks-type hybrid --chunks-max-tokens 512可以直接拿到按语义切块、带 token 上限的文本块省去再写一套切片代码。 性能加速问题出现时再上高级选项标准管线解析不准或太慢换 VLM 管线。它默认使用 GraniteDocling 视觉模型对复杂版面更鲁棒docling --pipeline vlm --vlm-model granite_docling paper.pdf--vlm-model还支持 smoldocling、got_ocr、deepseek_ocr、pixtral、qwen 等十余种预设可按精度与速度权衡。处理流程源码集中在 docling/pipeline/ 目录方便定位行为。有 GPU 却只用了 CPU用--device cudaNVIDIA或--device mps苹果芯片显式指定加速器Apple Silicon 上 Whisper 系列还有whisper_tiny_mlx等带mlx后缀的模型变体吃满 MLX 框架的加速。批量吞吐不够调--num-threads默认 4与--page-batch-size默认 4两个并发参数即可无需改代码。 避坑手册问Intel Mac 上装 PyTorch 报错答新版 PyTorch 已停供 Intel Mac 轮子改用pip install docling[mac_intel]且 Python 需 3.12 及以下。问tesserocr 编译失败答卸载后强制源码重装pip uninstall tesserocr再执行pip install --no-binary :all: tesserocr。问Tesseract 装好了但识别不到语言答检查TESSDATA_PREFIX是否指向语言文件目录且结尾必须带/。问--force-ocr没生效答该参数已弃用请改用--ocr-mode full_page。问大文档内存吃紧答用--page-range分批转换或调小--page-batch-size压低单批内存峰值。回头看这条学习路径先按输入类型选路线再用pip install docling加一条转换命令跑通闭环然后借助 CLI 的场景化参数处理批量与扫描件最后在速度或精度不够时叠加 VLM 管线与 GPU 加速。掌握这四步Docling 就能稳定接入你手头的文档解析需求。【免费下载链接】doclingGet your documents ready for gen AI项目地址: https://gitcode.com/GitHub_Trending/do/docling创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表