尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

PaddleOCR 2.10 全景解析:12 个自研模型、4 条多模型产线与低代码全流程开发能力

PaddleOCR 2.10 全景解析:12 个自研模型、4 条多模型产线与低代码全流程开发能力 PaddleOCR 2.10 全景解析12 个自研模型、4 条多模型产线与低代码全流程开发能力【免费下载链接】PaddleOCR飞桨多语言OCR工具包实用超轻量OCR系统支持80种语言识别提供数据标注与合成工具支持服务器、移动端、嵌入式及IoT设备端的训练与部署 Awesome multilingual OCR toolkits based on PaddlePaddle (practical ultra lightweight OCR system, support 80 languages recognition, provide data annotation and synthesis tools, support training and deployment among server, mobile, embedded and IoT devices)项目地址: https://gitcode.com/paddlepaddle/PaddleOCR本文以仓库首页文档 docs/index/index.md 为骨架结合 paddleocr/_models/ 与 paddleocr/_pipelines/ 源码系统梳理 PaddleOCR 2.10 版本发布的 12 个自研单模型、4 条高价值多模型组合产线以及基于 PaddleX 的低代码全流程开发能力。读者读完可掌握 PaddleOCR 当前模型矩阵与产线体系的全貌、各模型与产线的源码级调用方式以及如何在服务器、移动端、嵌入式与 IoT 设备上完成从数据生产、训练、压缩到部署的完整链路。一、PaddleOCR 是什么定位与整体能力PaddleOCR 是飞桨PaddlePaddle生态下主打丰富、领先、实用的 OCR 工具库目标是为开发者提供一条从模型训练到应用落地的完整路径。围绕这一目标它沉淀了三层能力见 docs/index/index.md算法覆盖广支持多种 OCR 相关前沿算法涵盖文本检测、文本识别、方向分类、表格结构识别、版面分析、公式识别、文档图像矫正、印章识别等方向产业级特色模型在算法之上打造了 PP-OCR通用文字识别、PP-Structure文档结构解析与 PP-ChatOCR文档场景信息抽取三条产业级模型/产线体系全流程打通从数据生产、模型训练、模型压缩到预测部署形成闭环可部署到服务器、移动端、嵌入式与 IoT 设备。从当前仓库源码可以看到这一能力的落地形态paddleocr/_models/__init__.py中导出了 13 个可直接调用的单功能模型封装paddleocr/_pipelines/__init__.py中导出了 9 条多模型组合产线封装二者共同构成了单模型 产线的双层 API 体系详见后文第四节。二、版本演进主线从 2.10 到低代码全流程官方首页以近期更新时间线呈现了 PaddleOCR 近几个版本的核心动作见 docs/index/index.md时间版本核心内容2025.3.7PaddleOCR 2.10新增 OCR 领域 12 个自研单模型 4 条多模型组合产线2024.10.1低代码能力依托 PaddleX 支持 OCR 领域低代码全流程开发模型产线一键调用2024.7冠军方案收录 PaddleOCR 算法模型挑战赛两个赛题的冠军方案其中 2025.3.7 发布的 2.10 版本是近期的重磅版本文档明确指出其两大方向单模型扩充一次性新增 12 个自研单模型覆盖版面区域检测、公式识别、表格结构识别、表格分类、表格单元格检测、文本识别、文本行方向分类 7 个方向产线升级重磅推出文档图像预处理、版面解析 v2、表格识别 v2、PP-ChatOCRv4-doc 共 4 条高价值多模型组合方案。后续更新动态可关注仓库内 docs/update/update.md。三、12 个自研单模型矩阵详解PaddleOCR 2.10 新增的 12 个自研单模型可按下表归类方向模型关键能力/参数版面区域检测PP-DocLayout-L / M / S支持 23 个常见版面类别覆盖中英论文、研报、试卷、书籍、杂志、合同、报纸等官方发布说明称 mAP0.5 最高达 90.4%轻量模型端到端每秒处理超百页文档图像公式识别PP-FormulaNet-L / S支持 5 万种 LaTeX 常见词汇可识别高难度印刷公式与手写公式表格结构识别SLANeXt_wired / SLANeXt_wireless分别面向有线表格与无线表格的结构预测是 SLANet_plus 的升级版本表格分类PP-LCNet_x1_0_table_cls超轻量级有线/无线表格分类模型表格单元格检测RT-DETR-L_wired_table_cell_det / RT-DETR-L_wireless_table_cell_det配合结构识别、文本检测、文本识别完成表格端到端预测文本识别PP-OCRv4_server_rec_doc支持 1.5 万字典文字识别范围更广文本行方向分类PP-LCNet_x0_25_textline_ori存储仅 0.3M 的超轻量级方向分类模型上述方向在源码中均有对应的模型封装类见 paddleocr/_models/init.py版面检测 →LayoutDetectionpaddleocr/_models/layout_detection.py公式识别 →FormulaRecognitionpaddleocr/_models/formula_recognition.py表格结构识别 →TableStructureRecognitionpaddleocr/_models/table_structure_recognition.py表格分类 →TableClassificationpaddleocr/_models/table_classification.py表格单元格检测 →TableCellsDetectionpaddleocr/_models/table_cells_detection.py文本识别 →TextRecognitionpaddleocr/_models/text_recognition.py文本行方向分类 →TextLineOrientationClassificationpaddleocr/_models/textline_orientation_classification.py3.1 从源码看默认模型配置从当前仓库源码结构看每个模型类都通过default_model_name属性声明其默认使用的预训练模型例如TableClassification.default_model_name返回PP-LCNet_x1_0_table_clspaddleocr/_models/table_classification.pyTextLineOrientationClassification.default_model_name返回PP-LCNet_x0_25_textline_oripaddleocr/_models/textline_orientation_classification.pyTableCellsDetection.default_model_name返回RT-DETR-L_wired_table_cell_detpaddleocr/_models/table_cells_detection.py。同时可以注意到仓库当前代码中的部分默认模型已经较 2.10 发布说明进一步演进例如LayoutDetection的默认模型为PP-DocLayout_plus-Lpaddleocr/_models/layout_detection.py、FormulaRecognition的默认模型为PP-FormulaNet_plus-Mpaddleocr/_models/formula_recognition.py、TextRecognition的默认模型为PP-OCRv6_medium_recpaddleocr/_models/text_recognition.py。这体现了 PaddleOCR 模型在持续迭代更新读者在实际使用时应以所安装版本为准。3.2 模型与 CLI 子命令的一一对应源码为每个模型类都挂载了一个 CLI 子命令执行器get_cli_subcommand_executor将 Python API 与命令行工具统一起来。以TextRecognition为例paddleocr/_models/text_recognition.py其 CLI 子命令text_recognition除通用推理参数外还额外支持--input_shape C H W 指定模型输入形状channel, height, width其他模型如公式识别、表格结构识别则通过add_simple_inference_args注入统一的简单推理参数方便在命令行中指定图片路径、模型目录、设备等。四、4 条高价值多模型组合产线单模型之外PaddleOCR 2.10 的核心亮点是 4 条多模型组合产线方案。产线的意义在于单一 OCR 模块难以覆盖复杂文档场景通过将多个模型按固定流程编排可端到端解决实际业务问题。产线组合内容典型输出文档图像预处理产线文档方向分类 图像矫正unwarping等超轻量模型矫正、转正后的文档图像版面解析 v2 产线版面检测、文本检测/识别、表格、公式、印章、图表等多个 OCR 类模型PDF/图片 → Markdown / JSON表格识别 v2 产线表格分类 表格单元格检测 表格结构识别 文本检测 文本识别多种样式的表格结构预测PP-ChatOCRv4-doc 产线PP-ChatOCRv3-doc 多模态大模型 优化后的 Prompt 与后处理文档场景信息抽取结果4.1 源码中的产线封装当前仓库的 paddleocr/_pipelines/init.py 导出了 9 条产线其中与 2.10 版本强相关的包括DocPreprocessorpaddleocr/_pipelines/doc_preprocessor.py文档图像预处理产线构造函数可配置doc_orientation_classify_model_name方向分类模型、doc_unwarping_model_name图像矫正模型并通过use_doc_orientation_classify、use_doc_unwarping两个开关控制是否启用对应子模块PPStructureV3paddleocr/_pipelines/pp_structurev3.py版面解析 v2 产线的核心实现其构造参数完整覆盖了布局检测、文本检测、文本行方向分类、文本识别、表格分类、有线/无线表格结构识别、有线/无线表格单元格检测、表格方向分类、印章检测/识别、公式识别、图表识别、区域检测、文档方向分类与矫正等 20 子模块TableRecognitionPipelineV2表格识别 v2 产线PPChatOCRv4DocPP-ChatOCRv4-doc 产线。4.2 以 PPStructureV3 为例理解产线编排从 paddleocr/_pipelines/pp_structurev3.py 的源码可以看到产线设计的几个关键点OCR 版本可切换通过ocr_version参数选择 PP-OCRv3 / PP-OCRv4 / PP-OCRv5源码中_SUPPORTED_OCR_VERSIONS [PP-OCRv3, PP-OCRv4, PP-OCRv5]会校验传入值非法版本直接抛出ValueError按需组合子模块use_seal_recognition、use_table_recognition、use_formula_recognition、use_chart_recognition、use_region_detection、use_doc_orientation_classify、use_doc_unwarping、use_textline_orientation等布尔开关决定产线运行哪些子模型实现按业务裁剪流程统一配置覆盖产线通过_get_paddlex_config_overrides将 Python 侧参数映射为 PaddleX 配置结构如SubModules.DocOrientationClassify.model_name实现 Python API 与底层推理配置的解耦。这种模型可替换、模块可开关、版本可切换的设计正是官方文档所述用户可自定义微调其中任意模块以提升垂类效果的源码级支撑。五、低代码全流程开发PaddleX 一体化能力2024.10.1 起PaddleOCR 依托飞桨低代码开发工具 PaddleX将 OCR 领域能力整合为低代码全流程开发方案见 docs/index/index.md模型丰富、一键调用将文本图像智能分析、通用 OCR、通用版面解析、通用表格识别、公式识别、印章文本识别涉及的 17 个模型整合为 6 条模型产线通过极简 Python API 一键调用同一套 API 还覆盖图像分类、目标检测、图像分割、时序预测等 200 模型支持自由组合降低门槛、提升效率提供统一命令与图形界面两种使用方式支持高性能推理、服务化部署和端侧部署等多种部署方式在英伟达 GPU、昆仑芯、昇腾、寒武纪、海光等主流硬件上可无缝切换。同时该版本还引入了多项新能力基于 RT-DETR 的高精度版面区域检测模型与基于 PicoDet 的高效率版面区域检测模型、高精度表格结构识别模型 SLANet_Plus、文本图像矫正模型 UVDoc、公式识别模型 LatexOCR、基于 PP-LCNet 的文档图像方向分类模型以及文档场景信息抽取 v3 方案 PP-ChatOCRv3-doc。2024.7 版本则收录了 PaddleOCR 算法模型挑战赛两个赛题的冠军方案场景文本识别算法 SVTRv2OCR 端到端识别赛题与表格识别算法 SLANet-LCNetV2通用表格识别赛题对应模型配置可参考仓库 configs/rec/PP-OCRv5/ 等目录。六、效果展示PP-OCRv3 与 PP-Structure 实测示例官方首页对核心能力的实际效果做了集中展示这里选取两张代表性效果图PP-OCRv3 中文模型效果覆盖自然场景与文档图像中的中文文字检测与识别完整效果展示还包括PP-OCRv3 英文数字模型en_1.png、en_2.png、en_3-0398013.png、PP-OCRv3 多语言模型japan_2.jpg、korean_1.jpg以及 PP-Structure 文档分析能力版面分析 表格识别ppstructure-20240708082235651.gif对文档页面进行版面区域划分并还原表格结构SER 语义实体识别185310636-6ce02f7c-790d-479f-b163-ea97a5a04808-20240708082238739.jpg 等识别文档中的实体类别RE 关系提取185393805-c67ff571-cf7e-4217-a4b0-8b396c4f22bb-20240708082310650.jpg 等抽取实体之间的语义关系。这两类效果对应仓库中的完整实现PP-OCR 系列模型配置文件见 configs/det/ 与 configs/rec/PP-Structure 的预测入口见 ppstructure/predict_system.py 及 ppstructure/kie/ 等目录。七、社区治理与开源许可PaddleOCR 由 PMC项目管理委员会监督Issues 与 PRs 会在尽力基础上进行审查见 docs/index/index.md。需要注意的协作规范是Issues 模块仅用于报告程序 Bug其余使用类问题应移步 Discussions 模块提问非 Bug 的 Issue 会被转移到 Discussions。项目以 Apache 2.0 许可证发布见仓库根目录 LICENSE允许商业使用、修改与再分发这也是其被大量产业项目采用的基础。八、如何进一步深入本文围绕官方首页展开的版本全貌只是进入 PaddleOCR 的起点读者可按需深入以下仓库资源单模型调用阅读 paddleocr/_models/init.py 与各模型实现如 paddleocr/_models/text_detection.py、paddleocr/_models/text_recognition.py掌握 13 个单功能模型的 Python API 与 CLI 用法产线编排阅读 paddleocr/_pipelines/init.py 与 paddleocr/_pipelines/pp_structurev3.py理解多模型组合的开关与配置机制模型配置对照 configs/det/、configs/rec/、configs/table/、configs/kie/ 中的 YAML 配置理解训练与推理参数部署方案仓库 deploy/ 提供了 Android、iOS、C 服务端、端侧lite等多种部署示例版本更新日志持续关注 docs/update/update.md获取后续版本的模型与产线动态。说明本文涉及的精度、速度等量化指标如 mAP0.5 90.4%、存储 0.3M、相对精度提升若干百分点等均转述自官方发布说明 docs/index/index.md实际效果会随数据集与运行环境不同而变化建议以实测为准。【免费下载链接】PaddleOCR飞桨多语言OCR工具包实用超轻量OCR系统支持80种语言识别提供数据标注与合成工具支持服务器、移动端、嵌入式及IoT设备端的训练与部署 Awesome multilingual OCR toolkits based on PaddlePaddle (practical ultra lightweight OCR system, support 80 languages recognition, provide data annotation and synthesis tools, support training and deployment among server, mobile, embedded and IoT devices)项目地址: https://gitcode.com/paddlepaddle/PaddleOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表