尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

PaddleOCR-VL-1.5:飞桨 0.9B 文档解析视觉语言模型的升级解读与实战指南

PaddleOCR-VL-1.5:飞桨 0.9B 文档解析视觉语言模型的升级解读与实战指南 PaddleOCR-VL-1.5飞桨 0.9B 文档解析视觉语言模型的升级解读与实战指南【免费下载链接】PaddleOCR飞桨多语言OCR工具包实用超轻量OCR系统支持80种语言识别提供数据标注与合成工具支持服务器、移动端、嵌入式及IoT设备端的训练与部署 Awesome multilingual OCR toolkits based on PaddlePaddle (practical ultra lightweight OCR system, support 80 languages recognition, provide data annotation and synthesis tools, support training and deployment among server, mobile, embedded and IoT devices)项目地址: https://gitcode.com/paddlepaddle/PaddleOCRPaddleOCR-VL-1.5 是飞桨 PaddleOCR 在 PaddleOCR-VL 初代版本v1基础上推出的增强版文档解析视觉语言模型VLM在 OmniDocBench v1.5 基准上取得了 94.5% 的新纪录并在扫描、弯曲、倾斜、屏摄、光照五个真实物理畸变场景构成的 Real5-OmniDocBench 基准上全面达到 SOTA。本文以仓库文档 PaddleOCR-VL-1.5.md 为核心结合 PaddleOCR-VL 使用教程 与 源码实现系统讲解其核心特性、两阶段技术架构、性能表现并给出从环境搭建、CLI / Python API 推理到长文档跨页解析、VLM 推理服务接入的完整实战路径。一、模型简介0.9B 参数的文档解析新标杆PaddleOCR-VL-1.5在 1.0 版本基础上进行了能力扩展与升级优化在文档解析基准OmniDocBench v1.5上取得了94.5%的更高准确率。为严格评估模型对现实世界物理畸变的鲁棒性——包括扫描伪影、倾斜、弯曲、屏摄和光照变化——官方提出了Real5-OmniDocBench基准测试实验表明增强模型在该基准的各个场景中均达到 SOTA 性能。同时模型通过新增印章识别与文本检测识别spotting任务扩展了能力边界并保持了0.9B 的超紧凑 VLM 规模与高效率。从源码可以确认PaddleOCR-VL 系列在 PaddleOCR 中被抽象为统一的PaddleOCRVL产线类通过pipeline_version参数在v1、v1.5、v1.6之间切换默认v1.6其中v1.5即对应本文介绍的 PaddleOCR-VL-1.5见 paddleocr/_pipelines/paddleocr_vl.py。因此用户无需感知版本差异即可用同一套接口调用该模型。核心特性一览文档解析的 SOTA 性能凭借 0.9B 参数量在 OmniDocBench v1.5 上达到 94.5% 准确率超越上一代 PaddleOCR-VL在表格、公式和文本识别方面均有显著提升。现实 5 大场景文档解析的 SOTA 性能引入支持不规则形状异形框定位的文档解析方法可在文档倾斜和弯曲条件下实现精确的多边形检测在扫描、弯曲、倾斜、屏摄和光照变化五个现实场景的评估中表现优于主流开源与闭源模型。0.9B 紧凑架构扩充能力新增文本行定位与识别spotting以及印章识别相关指标在各自任务中创下新的 SOTA 结果。强化多元素识别能力针对特殊符号、古籍、多语言表格、下划线和复选框的识别性能得到提升语言覆盖范围扩展至包括中国藏文和孟加拉语。长文档跨页解析支持跨页表格自动合并和跨页段落标题识别有效缓解长文档解析中的内容碎片化问题。二、技术架构版面分析 VLM 识别的两阶段流程PaddleOCR-VL 整体由版面分析与VLM 识别两个核心阶段组成PaddleOCR-VL-1.5 沿用该架构详见 PaddleOCR-VL 使用教程 的流程说明第一阶段版面分析模型以整图作为输入检测并定位图像中的各类版面元素如表格、公式、文本、标题等同时确定其阅读顺序并根据检测结果裁剪出对应的元素子图第二阶段VLM 识别将每个子图独立输入 VLM生成对应的识别结果例如 Markdown 文本随后按照版面分析阶段给出的顺序对各元素结果进行合并得到整幅图像的完整解析结果。因此若需使用 PaddleOCR-VL 的完整能力必须采用版面分析与 VLM 识别协同的完整流程而不能仅单独使用 VLM。这一点在使用中有重要实践意义直接通过 Transformers 本地执行 PaddleOCR-VL-0.9B 模型或直接请求 vLLM / SGLang / FastDeploy 服务都不等同于运行完整的 PaddleOCR-VL 流程可能无法复现官方精度或出现大量幻觉文本。以初代版本为例版面分析模型为 PP-DocLayoutV2VLM 组件为 PaddleOCR-VL-0.9B——该 VLM 由 NaViT 风格的动态分辨率视觉编码器与 ERNIE-4.5-0.3B 语言模型组成支持 109 种语言详见 PaddleOCR-VL.md。异形框定位与 shape 模式PaddleOCR-VL-1.5 的核心创新之一在于异形框不规则形状定位使版面分析不再局限于水平矩形框。在推理参数中这通过layout_shape_mode参数体现默认auto支持四种几何形状表示模式取值含义适用场景rect水平正向边界框x1, y1, x2, y2标准的水平排版版面quad由四个顶点组成的任意四边形存在倾斜、透视变形的区域poly由多个坐标点组成的闭合轮廓精度最高形状不规则或具有弧度的版面元素auto系统根据检测目标的复杂程度和置信度自动选择最合适的形状表达方式通用场景默认正是由于支持多边形级别的区域定位模型才能在文档倾斜、弯曲等条件下实现精确的版面元素提取支撑其在 Real5-OmniDocBench 五个真实场景中达到 SOTA。三、模型性能两大基准全面领先1. OmniDocBench v1.5标准文档解析基准PaddleOCR-VL-1.5 在 OmniDocBench v1.5 的整体、文本、公式、表格和阅读顺序等维度均达到最先进的性能综合准确率达 94.5%其中表格、公式和文本识别的提升尤为明显。该基准的评估细节与对比结果可参考原文档中的性能图表见 PaddleOCR-VL-1.5.md。2. Real5-OmniDocBench真实场景鲁棒性基准Real5-OmniDocBench 是基于 OmniDocBench v1.5 数据集构建的、面向真实场景的全新基准包含五个场景扫描Scanning、扭曲Warping、屏摄Screen-photography、光照Illumination和倾斜Skew。PaddleOCR-VL-1.5 在这五个多样化且具挑战性的场景中均创下新的 SOTA 记录验证了其在非理想拍摄条件下的实用性——这正是手机拍照、扫描仪低质量成像、翻拍书籍等真实业务中常见的输入形态。3. 推理部署性能在推理效率方面官方在 OmniDocBench v1.5 上进行了端到端推理性能对比PDF 文档在单张 NVIDIA A100 GPU 上以 512 的 batch size 处理报告的端到端运行时间包含 PDF 渲染和 Markdown 生成所有方法均依赖其内置 PDF 解析模块和默认 DPI 设置以反映开箱即用的性能。结合上一代模型文档的说明见 PaddleOCR-VL.md推理工作流引入了多线程异步执行数据加载如将 PDF 页面渲染为图像、版面模型处理和 VLM 推理三个阶段分别运行在独立线程中数据通过队列在相邻阶段之间传输实现并发执行。这一设计在源码中对应use_queues参数默认True在PaddleOCRVL产线中通过内部队列异步传递数据对页数较多的 PDF 或包含大量文件的目录尤其高效。四、快速上手环境准备与首次推理以下内容依据 PaddleOCR-VL 使用教程 整理适用于 x64 CPU 与除 Blackwell 之外的 NVIDIA GPU 用户。1. 环境准备官方提供两种环境准备方式强烈推荐 Docker 镜像方式以最大限度减少环境问题要求 Docker 19.03、NVIDIA 驱动支持 CUDA 12.6 或以上docker run \ -it \ --gpus all \ --network host \ --user root \ ccr-2vdh3abv-pub.cnc.bj.baidubce.com/paddlepaddle/paddleocr-vl:latest-nvidia-gpu \ /bin/bash若无法使用 Docker可手动安装Python 3.9–3.13建议在虚拟环境中进行。先安装推理引擎NVIDIA GPU 使用python -m pip install paddlepaddle-gpu3.2.1 -i https://www.paddlepaddle.org.cn/packages/stable/cu126/x64 CPU 使用python -m pip install paddlepaddle3.2.1 -i https://www.paddlepaddle.org.cn/packages/stable/cpu/注意不允许同时安装 CPU 和 GPU 版本随后安装 PaddleOCR 文档解析依赖python -m pip install -U paddleocr[doc-parser]2. CLI 命令行方式体验首次运行时模型会自动下载请确保网络可用并预留初始化时间。建议附加--save_path ./output保存结果paddleocr doc_parser -i https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/paddleocr_vl_demo.png --save_path ./output常用开关示例# 启用文档方向分类 paddleocr doc_parser -i 输入图像或PDF --use_doc_orientation_classify True --save_path ./output # 启用文本图像矫正如弯曲、透视文档 paddleocr doc_parser -i 输入图像或PDF --use_doc_unwarping True --save_path ./output # 关闭版面分析仅使用 VLM 组件适合车牌、票据等非标准文档 paddleocr doc_parser -i 输入图像或PDF --use_layout_detection False --save_path ./output命令行底层由 PaddleOCRVLCLISubcommandExecutor 实现其子命令名为doc_parser可通过--pipeline_version指定v1/v1.5/v1.6并支持--layout_threshold、--layout_nms、--vl_rec_backend、--use_seal_recognition、--use_chart_recognition等完整参数集。若需切换到 transformers 引擎追加--engine transformers即可。3. Python API 集成from pathlib import Path from paddleocr import PaddleOCRVL output_dir Path(./output) output_dir.mkdir(parentsTrue, exist_okTrue) pipeline PaddleOCRVL() # 默认使用 v1.6切换 1.5 版本PaddleOCRVL(pipeline_versionv1.5) # 可选开关 # pipeline PaddleOCRVL(use_doc_orientation_classifyTrue) # pipeline PaddleOCRVL(use_doc_unwarpingTrue) # pipeline PaddleOCRVL(use_layout_detectionFalse) output pipeline.predict(https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/paddleocr_vl_demo.png) for res in output: res.print() # 打印结构化输出 res.save_to_json(save_pathoutput_dir) # 保存 JSON res.save_to_markdown(save_pathoutput_dir) # 保存 Markdown res.save_to_word(save_pathoutput_dir) # 保存 Wordpredict_iter()与predict()参数和结果一致区别在于前者返回 generator适合大型数据集或节省内存的场景。对于多个文件建议将目录路径或文件路径列表传入predict以最大化处理效率例如pipeline.predict(imgs)或pipeline.predict([imgs/file1.png, imgs/file2.png])。五、关键参数详解与默认行为以下参数在 CLI 与 Python API 中通用详见 PaddleOCR-VL 使用教程 参数表参数含义默认值pipeline_version产线版本可选v1/v1.5/v1.6v1.6use_doc_orientation_classify是否使用文档方向分类模块Falseuse_doc_unwarping是否使用文本图像矫正模块Falseuse_layout_detection是否使用版面分析模块Trueuse_chart_recognition是否使用图表解析功能Falseuse_seal_recognition是否使用印章识别功能Falseuse_ocr_for_image_block是否对图片块中的文字进行识别Falseformat_block_content是否将block_content格式化为 MarkdownFalsemerge_layout_blocks是否合并跨栏或上下交错分栏的版面检测框Truemarkdown_ignore_labels在 Markdown 中忽略的版面标签[number,footnote,header,header_image,footer,footer_image,aside_text]layout_threshold版面模型得分阈值0-1 浮点数也支持按类别 ID 的 dict初始化默认值layout_nms版面分析是否使用后处理 NMS初始化默认值layout_unclip_ratio版面检测框扩张系数0支持 float / tuple / dict初始化默认值layout_merge_bboxes_mode重叠框过滤方式large保留外框、small保留内框、union全部保留初始化默认值layout_shape_mode版面结果的几何形状表示rect/quad/poly/autoautouse_queues是否启用内部队列异步处理加载 / 版面 / VLM 三阶段流水线Trueprompt_labelVLM 的 prompt 类型仅当use_layout_detectionFalse时生效可填ocr/formula/table/seal/chart/spottingNonerepetition_penalty/temperature/top_pVLM 采样参数Nonemin_pixels/max_pixelsVLM 预处理图像的像素数上下限Nonemax_new_tokensVLM 生成的最大 token 数Nonedevice推理设备如cpu、gpu:0、xpu、dcu、metax_gpu等GPU 0 优先否则 CPU实操建议车牌、火车票、身份证等非标准文档版面检测主要面向标准文档场景训练若检测结果不理想可将use_layout_detection设为False直接使用 PaddleOCR-VL-0.9B 模型配合prompt_label指定任务类型。图表、印章识别默认关闭需分别设置use_chart_recognitionTrue、use_seal_recognitionTrue开启。VLM 输入分辨率可通过vlm_extra_args按元素类型独立控制分辨率例如ocr_min_pixels/ocr_max_pixels、table_min_pixels/table_max_pixels、seal_min_pixels/seal_max_pixels等。六、长文档跨页解析表格合并与标题重建针对 PaddleOCR-VL-1.5 强调的长文档跨页解析能力PaddleOCR 在 Python API 中提供了restructure_pages()方法源码定义用于对多页推理结果进行页面重建pipeline PaddleOCRVL() output pipeline.predict(input./your_pdf_file.pdf) # PDF 按页处理 pages_res list(output) # 基础重建默认已合并跨页表格、重建多级标题 output pipeline.restructure_pages(pages_res) # 按需控制 # output pipeline.restructure_pages(pages_res, merge_tablesTrue) # 合并跨页表格 # output pipeline.restructure_pages(pages_res, merge_tablesTrue, relevel_titlesTrue) # 跨页表格合并 多级标题重建 # output pipeline.restructure_pages(pages_res, merge_tablesTrue, relevel_titlesTrue, concatenate_pagesTrue) # 进一步合并多页结果为一页 for res in output: res.print() res.save_to_json(save_pathoutput_dir) res.save_to_markdown(save_pathoutput_dir)restructure_pages()的核心参数包括res_list多页推理结果列表、merge_tables是否合并跨页表格默认True、relevel_titles是否重建多级标题默认True、concatenate_pages是否拼接多页结果为一页默认False。这一机制直接对应模型特性中跨页表格自动合并和跨页段落标题识别的能力可显著缓解长文档解析中的内容碎片化问题。七、生产级推理接入 VLM 推理服务本地直推适合功能验证其推理速度、显存占用及稳定性未必满足生产要求。生产环境强烈建议使用专门的 VLM 推理服务思路是客户端继续负责版面分析等完整流程中的其他环节仅将 VLM 推理交给专用服务处理。1. 启动 VLM 推理服务推荐使用官方 Docker 镜像启动 vLLM 或 FastDeploy 服务要求 GPU 且驱动支持 CUDA 12.6# vLLM 服务 docker run \ -it --rm --gpus all --network host \ ccr-2vdh3abv-pub.cnc.bj.baidubce.com/paddlepaddle/paddleocr-genai-vllm-server:latest-nvidia-gpu \ paddleocr genai_server --model_name PaddleOCR-VL-1.6-0.9B --host 0.0.0.0 --port 8118 --backend vllm也可通过 CLI 手动安装依赖后启动paddleocr install_genai_server_deps vllm支持 vllm / sglang / fastdeploy或直接使用推理加速框架原生启动vLLM、FastDeploy、MLX-VLM、llama.cpp但无法应用 PaddleOCR 预置的性能调优参数。2. 客户端接入paddleocr doc_parser \ --input https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/paddleocr_vl_demo.png \ --vl_rec_backend vllm-server \ --vl_rec_server_url http://localhost:8118/v1Python API 等价写法pipeline PaddleOCRVL( vl_rec_backendvllm-server, vl_rec_server_urlhttp://localhost:8118/v1, # vl_rec_api_model_namePaddlePaddle/PaddleOCR-VL-1.6, # 服务端模型名称按需 # vl_rec_api_keyxxxxxx, # 托管服务鉴权按需 )3. 性能调优要点服务端通过--backend_config指定 YAML 配置文件调整参数例如 vLLM 的gpu-memory-utilization: 0.3、max-num-seqs: 128。客户端通过vl_rec_max_concurrency调整最大并发请求数——PaddleOCR 会将多张输入图像中的子图分组并发请求服务端并发数对吞吐影响显著1 对 1 且服务端资源充足时可适当增加多客户端共享或资源有限时应降低。八、结语与延伸阅读PaddleOCR-VL-1.5 以 0.9B 的紧凑参数量在标准文档解析OmniDocBench v1.5 94.5%与真实物理畸变场景Real5-OmniDocBench 五大场景两个维度同时刷新纪录并通过异形框定位、印章识别、文本定位识别和跨页长文档解析拓展了模型的能力边界。结合 PaddleOCR 统一封装pipeline_version一键切换 v1 / v1.5 / v1.6开发者可以低成本地在既有项目中完成从快速验证到生产部署的完整链路。如需继续深入建议阅读以下仓库资源模型算法文档PaddleOCR-VL-1.5.md、PaddleOCR-VL.md完整使用教程含全部参数表与多语言服务调用示例PaddleOCR-VL 使用教程产线源码paddleocr/_pipelines/paddleocr_vl.pyVLM 模型封装paddleocr/_models/doc_vlm.py服务化部署容器编排deploy/paddleocr_vl_docker/【免费下载链接】PaddleOCR飞桨多语言OCR工具包实用超轻量OCR系统支持80种语言识别提供数据标注与合成工具支持服务器、移动端、嵌入式及IoT设备端的训练与部署 Awesome multilingual OCR toolkits based on PaddlePaddle (practical ultra lightweight OCR system, support 80 languages recognition, provide data annotation and synthesis tools, support training and deployment among server, mobile, embedded and IoT devices)项目地址: https://gitcode.com/paddlepaddle/PaddleOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表