尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Umi-OCR完整实操指南:免费离线OCR文字识别,从截图识别到批量转PDF

Umi-OCR完整实操指南:免费离线OCR文字识别,从截图识别到批量转PDF Umi-OCR完整实操指南免费离线OCR文字识别从截图识别到批量转PDF【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费、开源的离线 OCR 文字识别软件解压即用、无需联网支持截图识别、批量图片识别、PDF 文档识别与二维码扫描生成支持 Windows x64 与 Linux x64适合整理文字资料的办公用户和想把 OCR 接进脚本的开发者。跑通它从下载到看到第一个结果下载发布包.7z压缩包或.7z.exe自解压包解压到固定目录双击Umi-OCR.exe启动无需安装。软件默认停在「截图OCR」标签页按页面提示的快捷键唤起截图懒得截图也可以把别处复制的图片直接粘贴进窗口识别。框选屏幕上的文字区域左侧预览栏可以直接划选复制右侧「记录」面板里可以编辑后再复制。首次打开会按系统语言自动切换界面之后可随时在「全局设置 → 语言/Language」手动改。标签栏左上角有「窗口置顶」开关右上角可以锁定标签页防止误关先把这两个开关摸熟。核心能力按场景拆截图OCR把屏幕里的文字变成可选中、可编辑的文本适用场景网页、PDF阅读器、软件界面里的文字复制不出来。打开「截图OCR」标签页按页面提示的快捷键唤起截图框选区域也可粘贴剪贴板里的图片直接识别。左侧图片预览栏可直接用鼠标划选复制右侧「记录」面板支持编辑文字、划选多条记录一起复制。在「文本后处理 - 排版解析方案」里选方案「多栏-按自然段换行」适合报刊式双栏内容「单栏-保留缩进」适合代码截图能保留行首空格。横排、竖排文字都能自动处理竖排还需识别引擎本身支持。产出一段排版顺序正确、可直接粘贴进文档的文本。批量OCR一次把整个文件夹的图片转成文本文件适用场景一整个文件夹的图片如手机拍的讲义照片要逐张转文字。打开「批量OCR」标签页把图片文件夹拖进去支持jpg, jpe, jpeg, jfif, png, webp, bmp, tif, tiff等格式没有数量上限。在右栏勾选输出格式txt, jsonl, md, csv(Excel)可以多选同时保存。图片角落有水印或LOGO时在「忽略区域」编辑器里按住右键画矩形框住框内的整个文本块会在任务中被跳过。提交任务后可设置完成后自动关机/待机批量任务支持暂停待机/休眠后能恢复继续跑。产出与图片一一对应的文本文件几百张一次跑完。文档识别把PDF扫描件变成能搜索的PDF适用场景纯扫描版PDF没法用CtrlF搜索需要归档检索。打开「文档识别」标签页拖入文档支持pdf, xps, epub, mobi, fb2, cbz。文档自带文本层就直接提取纯扫描件则逐页OCR。输出勾选「双层可搜索PDF」并可用「忽略区域」排除页眉页脚的文字。可设置任务完成后自动关机/休眠跑完即走。产出一份版式不变、但文字可搜索、可复制的PDF。二维码扫得出来也生成得出来适用场景识别图片里的二维码/条形码或把一段文本变成二维码图片。扫码方向截图、粘贴或拖入本地图片支持一图多码覆盖QRCode、EAN13、DataMatrix、PDF417等19种协议。生成方向输入文本指定纠错等级和图片尺寸生成二维码图片。脚本里也能调命令行指令--qrcode_read、--qrcode_create详见 docs/README_CLI.md。产出解码结果文本或一张可直接使用的二维码图片。一次真实任务走完全程把一文件夹扫描件转成可搜索PDF准备在「文档识别」标签页确认输出目录把要识别的扫描版PDF下载到本地同一个文件夹。操作把扫描版PDF的整个文件夹拖入任务列表。若每页页脚都有页码水印先在「忽略区域」编辑器里按住右键把页脚条框住整块页脚文字就不会混进结果。输出勾选「双层可搜索PDF」任务完成设置选「自动关机」提交任务后就可以去忙别的。进度条会逐页推进中途电脑进入休眠也没关系批量任务支持暂停后恢复。结果输出目录里出现与原文件同名的双层可搜索PDF版式和原件一致CtrlF 能搜到任意文字任务跑完机器按设置自动关机。关键配置速查限制图像边长→ 识别超大长图、大图前 → 在识别页「设置 → 文字识别」里把数值调高否则超大图会被压缩截断。排版解析方案→ 多栏文档或代码截图时 → 在截图/批量页的「文本后处理」里选「多栏-按自然段换行」或「单栏-保留缩进」别一直用默认方案将就。OCR引擎插件→ 想对比速度或准确率时 → 在「全局设置」里切换 Rapid 与 Paddle 两套离线引擎批量任务前先小规模试跑。识别语言→ 要识别外语时 → 在OCR插件设置里勾选对应语言勾得越多内存占用越高纯中文场景不必全开。渲染器→ 老机器出现截图闪烁、界面错位时 → 「全局设置 → 界面和外观 → 渲染器」切换到其他渲染方案或关闭硬件加速。日志保存级别→ 排查问题想留证据时 → 在全局设置标签页中调整级别日志保存在UmiOCR-data/logs目录。排错速查批量识别大长图结果不完整。原因默认开启了图像边长限制超出部分被压缩或截断。 解决把「限制图像边长」数值调高。识别结果里总有水印、页眉页脚混进来。原因没画忽略区域或框没包住整个文本块。 解决用右键画矩形注意机制是框内整个文本块被忽略框要完全包住水印可能出现的所有位置。老显卡机器截图时闪烁、UI错位。原因默认显卡加速渲染与该机型不兼容。 解决全局设置里切换渲染方案或关闭硬件加速。脚本里调命令行收不到识别结果。原因umi-ocr无法用系统的、|重定向输出。 解决改用--output file.txt写文件完整手册见 docs/README_CLI.md。Linux 老系统启动报错。原因运行库依赖不满足。 解决选用release/开头的稳定版本Linux 侧要求 glibc 2.31 以上Debian 11、Ubuntu 20。参考与入口当前稳定版本为v2.1.52025.3.26新增日志机制和--reload配置重载指令完整沿革见 CHANGE_LOG.md。功能说明以 README.md 为准命令行与HTTP接口手册分别是 docs/README_CLI.md 和 docs/http/README.mdHTTP 接口可以传 Base64 图片直接识别适合写自动化脚本。需要源码或参与开发时执行git clone --single-branch --branch main https://gitcode.com/GitHub_Trending/um/Umi-OCRmain、dev分支可能含有开发中的不稳定功能研究学习可以日常使用请拿 release 版本或发行版压缩包。遇到Bug直接在项目的 Issue 页面提交界面翻译通过 Weblate 平台协作维护已覆盖英文、繁中、日文、俄语、葡萄牙语等十余种语言也欢迎译者参与补充。下载一个发行版解压先框一次截图你会发现离线OCR离你的工作流只差一个快捷键 【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表