尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

PaddleOCR PP-OCRv5 多语种文字识别完全指南:106 种语言覆盖、模型选型与实战接入

PaddleOCR PP-OCRv5 多语种文字识别完全指南:106 种语言覆盖、模型选型与实战接入 PaddleOCR PP-OCRv5 多语种文字识别完全指南106 种语言覆盖、模型选型与实战接入【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR核心导读本文围绕 PaddleOCR 新一代识别方案 PP-OCRv5 的多语种能力展开系统讲解其文字类型覆盖范围、106 种语言的模型分组机制、命令行与 Python 两种接入方式、各语种模型精度数据与适用场景并结合仓库源码语言分组定义、模型路由逻辑、多语种训练配置深入剖析lang参数背后的实现原理帮助你快速为韩文、泰文、阿拉伯文等任意目标语种选择并部署正确的识别模型。一、PP-OCRv5 多语种识别方案概述PP-OCRv5 是 PP-OCR 系列的新一代文字识别解决方案在多语种文字识别任务上实现了能力扩展与精度升级。在多语言支持方面PP-OCRv5 采取默认覆盖 专项模型的双层策略默认配置内置识别模型开箱即用可准确识别简体中文、中文拼音、繁体中文、英文、日文五大主流文字类型多语种扩展额外提供覆盖106 种语言的多语种文字识别能力包括韩文、西班牙文、法文、葡萄牙文、德文、意大利文、俄罗斯文、泰文、希腊文等具体语种与缩写对照见第四节。相比前代 PP-OCRv3PP-OCRv5 在多语言文字识别准确率上实现了超过 30% 的提升此为官方文档给出的对比数据。从指标对比可以看到韩文、天城文等语种相较前代模型的提升幅度甚至超过 60 个百分点。多语种识别效果示例以下为 PP-OCRv5 在法文、德文、韩文、俄文、泰文、希腊文、阿拉伯文、印地文、泰米尔文、泰卢固文等语种上的识别效果示例检测框 识别文本的可视化输出图片来自仓库文档目录说明可视化结果中不同颜色的矩形框为文本检测模型输出的文本行区域框内文本为识别模型输出的文字内容。日文、韩文等语种默认由覆盖五大主流文字类型的模型直接识别。二、快速使用命令行与 Python 两种接入方式2.1 命令行方式通过--lang指定语种在命令行中使用--lang参数即可使用指定语种的文本识别模型进行通用 OCR 产线推理# 通过 --lang 参数指定使用法语的识别模型 paddleocr ocr -i https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_french01.png \ --lang fr \ --use_doc_orientation_classify False \ --use_doc_unwarping False \ --use_textline_orientation False \ --save_path ./output \ --device gpu:0各参数含义如下参数含义-i输入图片路径支持本地路径或 URL--lang fr指定识别语种为法语系统据此自动选择对应的多语种识别模型--use_doc_orientation_classify False关闭文档方向分类适用于方向正常的扫描文档/截图可减少耗时--use_doc_unwarping False关闭文本图像矫正针对非弯曲/非畸变文档可关闭--use_textline_orientation False关闭文本行方向分类--save_path ./output可视化结果与 JSON 结果的保存目录--device gpu:0指定推理设备可替换为cpu或gpu:N完整参数说明可参考通用 OCR 产线的命令行使用方式。运行后结果被打印到终端核心字段包括dt_polys/rec_polys/rec_boxes检测框与识别框坐标rec_texts识别出的文本行内容如法语示例中的mifere; la profpérité les fuccès ac-等rec_scores每个文本行的识别置信度text_det_params本次推理使用的检测参数如thresh: 0.3、box_thresh: 0.6、unclip_ratio: 1.5等。若指定了save_path运行结束后会在该目录下保存可视化结果图片。2.2 Python 方式在PaddleOCR初始化时传入lang也可以在 Python 代码中通过PaddleOCR类的lang参数使用指定语种的识别模型from paddleocr import PaddleOCR ocr PaddleOCR( langfr, # 通过 lang 参数指定使用法语的识别模型 use_doc_orientation_classifyFalse, # 不使用文档方向分类模型 use_doc_unwarpingFalse, # 不使用文本图像矫正模型 use_textline_orientationFalse, # 不使用文本行方向分类模型 ) result ocr.predict(https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_french01.png) for res in result: res.print() # 终端打印识别结果 res.save_to_img(output) # 保存可视化结果 res.save_to_json(output) # 保存 JSON 结构化结果更多关于PaddleOCR类参数的说明可参考通用 OCR 产线的脚本方式集成。2.3lang参数背后的模型路由原理从源码看--lang/lang参数并非直接指定模型文件名而是触发一套语言分组 → 模型映射的自动路由逻辑ocr.py 中_get_ocr_model_names方法依据 langs.py 中定义的语言分组将lang缩写归入LATIN_LANGS、ARABIC_LANGS、ESLAV_LANGS、CYRILLIC_LANGS、DEVANAGARI_LANGS等集合不同分组映射到不同的 PP-OCRv5 专项模型例如ch/chinese_cht/japan→PP-OCRv5_server_rec默认五大文字类型模型en→en_PP-OCRv5_mobile_rec英文定向优化模型拉丁字母系语种如fr、de、es→latin_PP-OCRv5_mobile_rec东斯拉夫语系ru、be、uk→eslav_PP-OCRv5_mobile_rec阿拉伯字母系语种 →arabic_PP-OCRv5_mobile_rec西里尔字母系语种 →cyrillic_PP-OCRv5_mobile_rec天城文系语种如hi、mr、ne→devanagari_PP-OCRv5_mobile_reckorean/th/el/te/ta→ 各自独立的专项模型检测模型统一使用PP-OCRv5_server_det识别模型按上述规则自动选定无需手动指定模型路径。这也解释了为什么第四节中 106 种语言只需维护11 个多语种识别模型即可覆盖——同一文字系统如拉丁字母、西里尔字母的语言共用一套模型。三、多语种模型精度指标对比下表为 PP-OCRv5 各多语种模型在官方对应数据集上的精度以及与 PP-OCRv3 前代模型的提升幅度模型对应数据集精度%相比前代模型提升幅度%korean_PP-OCRv5_mobile_rec88.065.0latin_PP-OCRv5_mobile_rec84.746.8eslav_PP-OCRv5_mobile_rec81.631.4th_PP-OCRv5_mobile_rec82.68-el_PP-OCRv5_mobile_rec89.28-en_PP-OCRv5_mobile_rec85.2511.0cyrillic_PP-OCRv5_mobile_rec80.2721.2arabic_PP-OCRv5_mobile_rec81.2722.83devanagari_PP-OCRv5_mobile_rec84.9668.26te_PP-OCRv5_mobile_rec87.6543.47ta_PP-OCRv5_mobile_rec94.239.23数据集说明均为 PP-OCRv5 最新构建的评测数据韩语数据集5007 张韩语文本图片拉丁字母语言数据集3111 张文本图片东斯拉夫语言数据集俄语、白俄罗斯语、乌克兰语共 7031 张泰文数据集4261 张希腊文数据集2799 张英文数据集6530 张西里尔文数据集7600 张泰米尔语数据集2121 张泰卢固语数据集2478 张阿拉伯语数据集阿拉伯、梵语等共 2676 张天城文数据集3611 张。注th、el两项对应前代模型无对应可对比数据故提升幅度为空其余语种相较 PP-OCRv3 前代模型均有 11% 以上提升其中天城文、韩文提升最为显著超过 60 个百分点。模型下载链接见原文档第三节表格。四、支持语种及缩写106 种语言及其缩写完整对照如下语种、描述、缩写三列为一组共两组并排展示语种描述缩写语种描述缩写中文Chinese Englishch匈牙利文Hungarianhu英文Englishen塞尔维亚文latinSerbian(latin)rs_latin法文Frenchfr印度尼西亚文Indonesianid德文Germande欧西坦文Occitanoc日文Japanesejapan冰岛文Icelandicis韩文Koreankorean立陶宛文Lithuanianlt中文繁体Chinese Traditionalchinese_cht毛利文Maorimi南非荷兰文Afrikaansaf马来文Malayms意大利文Italianit荷兰文Dutchnl西班牙文Spanishes挪威文Norwegianno波斯尼亚文Bosnianbs波兰文Polishpl葡萄牙文Portuguesept斯洛伐克文Slovaksk捷克文Czechcs斯洛文尼亚文Sloveniansl威尔士文Welshcy阿尔巴尼亚文Albaniansq丹麦文Danishda瑞典文Swedishsv爱沙尼亚文Estonianet西瓦希里文Swahilisw爱尔兰文Irishga塔加洛文Tagalogtl克罗地亚文Croatianhr土耳其文Turkishtr乌兹别克文Uzbekuz拉丁文Latinla俄罗斯文Russianru白俄罗斯文Belarusianbe乌克兰文Ukranianuk泰文Thaith希腊文Greekel阿塞拜疆文Azerbaijaniaz库尔德文Kurdishku拉脱维亚文Latvianlv马耳他文Maltesemt巴利文Palipi罗马尼亚文Romanianro越南文Vietnamesevi芬兰文Finnishfi巴斯克文Basqueeu加利西亚文Galiciangl卢森堡文Luxembourgishlb罗曼什文Romanshrm加泰罗尼亚文Catalanca克丘亚文Quechuaqu泰卢固文Telugute塞尔维亚语西里尔字母Serbian (Cyrillic)rs_cyrillic保加利亚文Bulgarianbg蒙古文Mongolianmn阿布哈兹文Abkhazab阿迪赫文Adygheady卡巴尔达文Kabardiankbd阿瓦尔文Avarav达尔格瓦文Dargwadar印古什文Ingushinh车臣文Chechence拉克文Laklki列兹金文Lezgianlez塔巴萨兰文Tabasarantab哈萨克文Kazakhkk吉尔吉斯文Kyrgyzky塔吉克文Tajiktg马其顿文Macedonianmk鞑靼文Tatartt楚瓦什文Chuvashcv巴什基尔文Bashkirba马里文Marimhr莫尔多瓦文Moldovanmo乌德穆尔特文Udmurtudm科米文Komikv奥塞梯文Ossetianos布里亚特文Buriatbua卡尔梅克文Kalmykxal图瓦文Tuviniantyv萨哈文Sakhasah卡拉卡尔帕克语Karakalpakkaa阿拉伯文Arabicar波斯文Persianfa维吾尔文Uyghurug乌尔都文Urduur普什图文Pashtops库尔德文Kurdishku信德文Sindhisd俾路支文Balochibal印地文Hindihi马拉地文Marathimr尼泊尔文Nepaline比哈尔文Biharibh迈蒂利文Maithilimai古英文Old Englishang博杰普尔文Bhojpuribho马加希文Magahimah萨达里文Sadrisck尼瓦尔文Newarnew孔卡尼文Konkanigom梵文Sanskritsa哈里亚纳文Haryanvibgc泰米尔语Tamilta语种分组的源码印证上述缩写在仓库源码中有完整对应。例如 langs.py 中LATIN_LANGS集合包含af、az、bs、cs、de、fr、es、it、pt、tr等 48 个拉丁字母语种ARABIC_LANGS包含ar、fa、ug、ur、ps、ku、sd、bal共 8 个阿拉伯字母语种ESLAV_LANGS包含ru、be、uk3 个东斯拉夫语种CYRILLIC_LANGS包含 31 个西里尔字母语种含高加索地区小语种如阿布哈兹文、车臣文、列兹金文等DEVANAGARI_LANGS包含hi、mr、ne、sa等 13 个天城文语种。五、模型及其支持的语种PP-OCRv5 多语种识别由11 个识别模型 1 个统一检测模型构成每个识别模型对应一个或一组文字系统模型支持语种PP-OCRv5_server_rec简体中文、繁体中文、英文、日文PP-OCRv5_mobile_rec简体中文、繁体中文、英文、日文korean_PP-OCRv5_mobile_rec韩文、英文latin_PP-OCRv5_mobile_rec法文、德文、南非荷兰文、意大利文、西班牙文、波斯尼亚文、葡萄牙文、捷克文、威尔士文、丹麦文、爱沙尼亚文、爱尔兰文、克罗地亚文、乌兹别克文、匈牙利文、塞尔维亚文latin、印度尼西亚文、欧西坦文、冰岛文、立陶宛文、毛利文、马来文、荷兰文、挪威文、波兰文、斯洛伐克文、斯洛文尼亚文、阿尔巴尼亚文、瑞典文、西瓦希里文、塔加洛文、土耳其文、拉丁文、阿塞拜疆文、库尔德文、拉脱维亚文、马耳他文、巴利文、罗马尼亚文、越南文、芬兰文、巴斯克文、加利西亚文、卢森堡文、罗曼什文、加泰罗尼亚文、克丘亚文eslav_PP-OCRv5_mobile_rec俄罗斯文、白俄罗斯文、乌克兰文、英文th_PP-OCRv5_mobile_rec泰文、英文el_PP-OCRv5_mobile_rec希腊文、英文en_PP-OCRv5_mobile_rec英文cyrillic_PP-OCRv5_mobile_rec俄罗斯文、白俄罗斯文、乌克兰文、塞尔维亚文cyrillic、保加利亚文、蒙古文、阿布哈兹文、阿迪赫文、卡巴尔达文、阿瓦尔文、达尔格瓦文、印古什文、车臣文、拉克文、列兹金文、塔巴萨兰文、哈萨克文、吉尔吉斯文、塔吉克文、马其顿文、鞑靼文、楚瓦什文、巴什基尔文、马里文、莫尔多瓦文、乌德穆尔特文、科米文、奥塞梯文、布里亚特文、卡尔梅克文、图瓦文、萨哈文、卡拉卡尔帕克文、英文arabic_PP-OCRv5_mobile_rec阿拉伯文、波斯文、维吾尔文、乌尔都文、普什图文、库尔德文、信德文、俾路支文、英文devanagari_PP-OCRv5_mobile_rec印地文、马拉地文、尼泊尔文、比哈尔文、迈蒂利文、古英文、博杰普尔文、马加希文、萨达里文、尼瓦尔文、孔卡尼文、梵文、哈里亚纳文、英文ta_PP-OCRv5_mobile_rec泰米尔文、英文te_PP-OCRv5_mobile_rec泰卢固文、英文注en_PP-OCRv5_mobile_rec是在 PP-OCRv5 基础模型上针对英文场景定向优化的版本处理英文文本时表现出更高的识别精度与更强的场景适应能力。从 ocr.py 的模型路由 可以看到当langen时优先选用该英文专项模型。各模型对应的字典文件仓库中每个多语种模型都有配套的字符字典文件ppocr/utils/dict 目录训练/推理时通过配置文件中的character_dict_path指定。例如韩文模型使用ppocrv5_korean_dict.txt此外还有ppocrv5_latin_dict.txt、ppocrv5_arabic_dict.txt、ppocrv5_cyrillic_dict.txt、ppocrv5_devanagari_dict.txt、ppocrv5_eslav_dict.txt、ppocrv5_el_dict.txt、ppocrv5_th_dict.txt、ppocrv5_ta_dict.txt、ppocrv5_te_dict.txt、ppocrv5_en_dict.txt等与 11 个多语种模型一一对应。六、多语种模型的训练配置参考PP-OCRv5 多语种模型的完整训练配置位于 configs/rec/PP-OCRv5/multi_language 目录共 11 个 YAML 文件命名与模型一一对应如korean_PP-OCRv5_mobile_rec.yml、latin_PP-OCRv5_mobile_rec.yml、arabic_PP-OCRv5_mobile_rec.yaml等。以韩文模型 korean_PP-OCRv5_mobile_rec.yml 为例关键配置项配置块关键项说明Globalcharacter_dict_path: ./ppocr/utils/dict/ppocrv5_korean_dict.txt韩文字典路径Globalmax_text_length: 25最大文本长度Globaluse_space_char: true是否使用空格字符OptimizerAdam Cosinelearning_rate: 0.0005warmup_epoch: 5优化器与学习率调度Architecturealgorithm: SVTR_LCNetBackbone 为PPLCNetV3 (scale: 0.95)模型结构移动端轻量骨干ArchitectureHead: MultiHead包含CTCHead与NRTRHead双头结构CTC NRTRLossMultiLossCTCLossNRTRLoss多任务损失TrainMultiScaleDataSetMultiScaleSamplerscales: [[320, 32], [320, 48], [320, 64]]多尺度训练首轮 batch 128EvalRecResizeImgimage_shape: [3, 48, 320]评估时输入尺寸 48×320可见 PP-OCRv5 多语种模型沿用 SVTR_LCNetPPLCNetV3 骨干结构采用CTC NRTR 多标签训练与多尺度采样策略各语种配置差异主要集中在字典文件character_dict_path与训练数据上。训练流程可参考 tools/train.py 与 tools/eval.py。七、总结与选型建议你的需求推荐的lang取值实际加载的识别模型中文/繁体/日文通用识别ch/chinese_cht/japanPP-OCRv5_server_rec英文专项优化enen_PP-OCRv5_mobile_rec韩文koreankorean_PP-OCRv5_mobile_rec泰文 / 希腊文th/elth / el_PP-OCRv5_mobile_rec法语、德语、西班牙语等拉丁字母语系fr/de/es等latin_PP-OCRv5_mobile_rec俄语、白俄罗斯语、乌克兰语ru/be/ukeslav_PP-OCRv5_mobile_rec阿拉伯语、波斯语、乌尔都语等ar/fa/ur等arabic_PP-OCRv5_mobile_rec印地语、尼泊尔语、梵语等天城文语系hi/ne/sa等devanagari_PP-OCRv5_mobile_rec泰米尔语 / 泰卢固语ta/teta / te_PP-OCRv5_mobile_rec关键要点回顾一个lang参数完成全部切换命令行--lang与 Pythonlang均可触发模型自动路由无需手动下载和指定模型路径按文字系统而非语言选模型106 种语言按拉丁、西里尔、阿拉伯、天城文等文字系统归并为 11 个专项模型同一文字系统的语言可共用辅助功能按需开启文档方向分类、文本矫正、文本行方向分类等辅助模型会增加耗时方向正常的图片建议关闭以提升吞吐精度提升显著多语种模型精度数据与 PP-OCRv3 前代对比韩文65.0、天城文68.26等语种提升幅度超过 60 个百分点拉丁46.8、泰卢固43.47等也有 40% 以上提升可继续深入阅读算法整体介绍见 PP-OCRv5.md通用 OCR 产线完整用法见 OCR.md多语种训练配置见 configs/rec/PP-OCRv5/multi_language。【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表