尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

PaddleOCR 实战教程:把 PDF 和图片变成 LLM 可用的结构化数据

PaddleOCR 实战教程:把 PDF 和图片变成 LLM 可用的结构化数据 PaddleOCR 实战教程把 PDF 和图片变成 LLM 可用的结构化数据【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR做 RAG 知识库一种先从文档里检索相关片段、再交给大模型作答的方案时你大概率遇到过这个局面源头的 PDF 和扫描图片用常规解析器跑出来乱码、丢表格、公式变一堆方块。PaddleOCR 是一个开源 OCR 工具包它把 PDF 和图片转成 JSON、Markdown 这类 LLM 可直接消费的结构化数据并支持 100 语言的文本识别。 快速上手从安装到第一次识别先给结论在一个干净的 Python 环境里两条安装命令就能让首张图片跑通文字识别。环境要求如下组件要求说明Python3.8 – 3.12官方支持区间建议 3.10推理引擎PaddlePaddle ≥ 3.0 或 Transformers二选一默认走 PaddlePaddle硬件CPU 即可GPU 可选GPU 需装对应 CUDA 版本磁盘约 1GB首次运行会下载模型到本地缓存先装引擎和主包然后直接用命令行验证python -m pip install paddlepaddle python -m pip install paddleocr[all] paddleocr ocr -i ./general_ocr_002.png --use_doc_orientation_classify False --use_doc_unwarping False --use_textline_orientation False如果要在代码里调用几行就够from paddleocr import PaddleOCR ocr PaddleOCR( use_doc_orientation_classifyFalse, use_doc_unwarpingFalse, use_textline_orientationFalse, ) for res in ocr.predict(./general_ocr_002.png): res.print() res.save_to_json(output)res.print()会打印识别出的文本行和置信度save_to_json把带文本行坐标的结果落到磁盘。验证标准很直接输出里能对上图片中的文字行链路就通了。三个use_*开关分别控制文档方向分类、图像扭曲矫正、文本行方向分类处理正放的普通截图时关掉可以省时间。原理拆解“先找位置再认内容”的两阶段管线PP-OCR 系列的主干是一条两阶段管线检测负责“文字在哪里”识别负责“文字是什么”。检测主流的 DB 算法属于分割路线。网络不直接画框而是给每个像素预测一个“是否落在字符上”的概率再经过轮廓提取和非极大值抑制生成文本行框。好处是不受文字形状约束弯曲文本也能框出来代价是后处理多一步参数需要按场景微调。识别切出来的文本行图先过 CNN 提取特征再用双向 LSTM 建模字符序列训练和解码靠 CTC连接时序分类损失完成。CTC 关键在解决对齐难题输入图像像素数和输出字符数天然对不上CTC 允许两者无需逐位对齐就能训练。复杂版面如果文档里有表格、公式、混排内容更适合走文档解析路线。PaddleOCR-VL 是一个 0.9B 参数的视觉语言模型直接“看图输出文本”的模型整页解析后输出 MarkdownPP-StructureV3 则额外提供表格单元格坐标这类更细粒度的信息适合需要精确定位的场景。真实场景三个案例的效果与代价RAG 知识库构建。把 PDF 文档解析成 Markdown 再切片写入向量库。结构化输出会把表格、公式块保留为独立元素检索命中率通常优于对纯文本硬切。代价上百页文档单份解析需要数十秒到数分钟大批量任务要提前规划 GPU 排队或多进程并行精度优先选 PaddleOCR-VL要细粒度坐标选 PP-StructureV3。多语种文档数字化。PP-OCRv6 单个模型原生覆盖 50 种语言中文、英文、日文及 46 种拉丁字母语言中英混排的合同、报关单不用换模型反复跑。代价拍摄件如果透视变形或模糊严重检测召回会掉需要先做矫正和放大等预处理。批量数据生产。predict支持一次传入图片列表输出的 JSON 包含文本行坐标与置信度可以直接接到数据清洗和模型微调流水线上。代价大批量时要盯内存占用官方提供了并行推理的做法可以按需开启。️ 避坑指南常见现象与处理方式现象原因处理方式pip 安装报依赖冲突全局环境已有版本冲突新建虚拟环境再安装不要混装首次运行极慢模型首次运行时才下载到本地缓存检查网络或手动下载后通过model_dir指向本地文档整行漏检检测框置信度默认阈值偏严0.5把det_db_box_thresh调到 0.3 附近观察效果特定字符经常认错预训练语料中该字符样本少用领域数据微调单个字符样本建议不低于 300图片旋转后识别变差未做文本行方向分类打开use_textline_orientation开关大图预测显存溢出图像长边过大导致中间张量膨胀压缩输入长边或分批送入预测收尾OCR 之外还能往哪走PaddleOCR 的价值在于给 LLM 配了一个精度稳定、成本可控的“阅读器”Python 侧两条命令跑通仓库里还带了 Android、iOS、C、Docker 等部署样例训练入口和配置库同样齐全想用自己的数据微调不必另起炉灶。两个可以继续翻的入口高频问题的官方解答在docs/FAQ.md完整安装说明与参数解释在docs/quick_start.md需要端侧部署时看deploy/下的对应工程需要微调时从tools/train.py配合configs/里的配置起步。【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表