尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

GLM-OCR 按标签筛选结果:三步只提取表格或公式的实用技巧

GLM-OCR 按标签筛选结果:三步只提取表格或公式的实用技巧 GLM-OCR 按标签筛选结果三步只提取表格或公式的实用技巧【免费下载链接】GLM-OCRGLM-OCR: Accurate × Fast × Comprehensive项目地址: https://gitcode.com/GitHub_Trending/gl/GLM-OCRGLM-OCR 是一款面向复杂文档理解的多模态 OCR 模型在 OmniDocBench V1.5 上取得 94.62 分的综合第一。除了全量识别GLM-OCR 还支持按标签筛选结果通过配置版面标签映射你可以让模型只识别表格、只提取公式把无关区域直接丢弃省时省算力。本文用三个步骤带你掌握这套标签筛选技巧。为什么要按标签筛选 OCR 结果GLM-OCR 采用两阶段流水线先由 PP-DocLayout-V3 做版面分析把页面切成带标签的区域正文、表格、公式、标题、页眉页脚等 25 种标签再对各区域并行识别。默认配置下所有区域都会被处理输出的 Markdown 里正文、表格、公式混在一起。但实际业务中你可能只想拿到一张财务报表里的全部表格正文完全不要论文里的数学公式LaTeX文字部分跳过。按标签筛选有两个好处源端丢弃不需要的区域省去识别开销输出更干净直接得到目标内容。原理label_task_mapping 是筛选开关筛选功能的核心是配置文件 glmocr/config.yaml 中的pipeline.layout.label_task_mapping它决定每个版面标签的去向共有 5 种任务任务行为典型标签text以Text Recognition提示词识别abstract、content、text、seal……table以Table Recognition提示词识别tableformula以Formula Recognition提示词识别display_formula、inline_formulaskip保留区域但不识别chart、imageabandon区域直接丢弃不进输出header、footer、footnote……对应实现位于 glmocr/layout/layout_detector.py检测器遍历每个区域时查到abandon的标签会被continue跳过其余区域打上task_type进入识别队列。一句话理解想只提取表格就把 text 组下的所有标签搬进 abandon只留 table。步骤一编写只提取表格的自定义配置复制默认配置为table_only.yaml把label_task_mapping精简为pipeline: layout: label_task_mapping: table: - table abandon: - abstract - algorithm - aside_text - chart - content - doc_title - display_formula - figure_title - footer - footer_image - footnote - formula_number - header - header_image - image - inline_formula - number - paragraph_title - reference - reference_content - seal - text - vertical_text - vision_footnote标签全集可参考配置中的id2label编号 0~24。想只提取公式同理把display_formula和inline_formula留在formula组其余全部 abandon。步骤二一行命令运行筛选在 glmocr/cli.py 提供的 CLI 中用--config指定自定义配置即可# 只提取目录里的表格输出仅 JSON glmocr parse examples/source/table.png --config table_only.yaml --json-only不想改配置文件--set参数支持点号路径覆盖任意配置项临时覆盖非常方便glmocr parse examples/source/paper.png --set pipeline.layout.label_task_mapping.table table --json-only常用组合拳--json-only只输出 JSON不输出 Markdown--stdout --no-save结果打印到终端不落盘-o ./output指定输出目录自动保留输入目录层级。步骤三读懂输出二次过滤筛选后的 JSON 输出结构很简单每个保留下来的区块带有label、task_type、bbox_2d和识别内容。可以查看示例文件 examples/result/table/table.json其中label为tablecontent是完整的 HTML 表格。如果上游是 MaaS 云模式不做本地版面分析返回的layout_details里每个元素同样带type字段如table、formula你可以用脚本按type做二次过滤——相当于源端筛选 结果端筛选双保险。常见场景速查场景label_task_mapping 配置思路只要表格table 组保留table其余全部 abandon只要公式formula 组保留两种 formula 标签其余 abandon只要正文文字保持默认把 table、formula 挪进 abandon表格 公式混合table、formula 组保留text 组全部 abandon去页眉页脚header、footer、footnote 等保持 abandon默认即是小结GLM-OCR 的标签筛选能力让只提取表格或公式变得非常直接修改 glmocr/config.yaml 中的label_task_mapping把不需要的标签归入abandon用glmocr parse配合--config或--set运行在 JSON 输出的label/task_type字段上做二次校验。这套技巧配合 MaaS 云端模式或 vLLM/SGLang 自部署均可使用是批量处理财报、论文、票据等文档时提升效率的实用手段。【免费下载链接】GLM-OCRGLM-OCR: Accurate × Fast × Comprehensive项目地址: https://gitcode.com/GitHub_Trending/gl/GLM-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表