尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Umi-OCR:免费离线批量文字识别完整指南

Umi-OCR:免费离线批量文字识别完整指南 Umi-OCR免费离线批量文字识别完整指南【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费开源的离线 OCR 识别工具支持截图识别、批量文字提取、文档识别图片不出内网。如果你经常需要从截图、扫描件里提取文字这篇指南能帮你省掉翻文档的时间。 一、它适合谁先对号入座网页、远程桌面里的文字选不中框一下就要直接复制走一次丢进几百张扫描件自动输出 txt / csv省去逐张敲字的活拿到只有图片层的 PDF 扫描件要提取文字或导出可搜索的双层 PDF手头一堆带二维码、条形码的图片要批量解析内容或临时生成二维码公司对数据合规有要求图片不允许上传任何在线服务不适合的场景纯手写潦草字迹的识别、在线文档实时翻译离线引擎在这两类上准确率有限。 二、从零到第一次出结果系统要求Windows x64项目最低推荐系统Windows 7Windows 10/11 x64内存4GB8GB磁盘500MB 空闲1GB依赖无发布包已带运行库无选一种方式获取官方 release 的 7z 包蓝奏云、GitHub、SourceForge 均有、Scoop 执行scoop install extras/umi-ocr或git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR从源码构建。把 7z 解压到无中文无空格的路径如 D:\Umi-OCR双击Umi-OCR.exe直接启动无需安装。首次打开界面自动跟随系统语言之后可在「全局设置 → 语言/Language」切换。打开「截图OCR」标签页按默认热键AltPrintScreen框住一块文字。识别出的文字出现在右侧记录栏划选复制或右键「复制全部」第一次识别完成。切到「批量OCR」标签页选个文件夹点「开始任务」就能看着结果一张张列出来。框一下文字就出现在右边选中 CtrlC 收工——第一次出结果的感觉像有人替你打字。⚡ 三、核心能力逐个拆截图OCR识别框选即出文字场景屏幕上的文字选不中网页图片、远程桌面、图片版 PDF需要直接拿走。操作打开「截图OCR」标签页按AltPrintScreen唤起截图鼠标框选目标区域识别完成后右侧出现文字列表左栏原图上高亮各文本块划选预览图复制或右键记录栏选「复制全部」「复制选中记录」效果左边原图、右边结果每条记录带置信度和时间戳多条记录可划选合并复制。避坑多栏排版顺序乱把设置栏「文本后处理」从「不做处理」换成「多栏-按自然段换行」。代码缩进丢失后处理方案改选「单栏-保留缩进」。批量OCR识别几百张扫描件一次出结构化文本场景一个文件夹的扫描件、截图要全部转成文字存档。操作打开「批量OCR」标签页点「选择图片」选文件夹支持 jpg/png/webp/tif 等右栏设置识别语言、后处理方案选保存位置与文件格式txt、jsonl、md、csv点「开始任务」进度条实时显示张数与每张的置信度效果右侧记录列按文件名逐条展示结果csv 格式可直接用 Excel 打开筛选。避坑页脚水印干扰结果在「忽略区域」编辑器里按住右键画矩形框内整个文本块会被跳过。超大长图识别异常「页面设置 → 文字识别 → 限制图像边长」从默认 960 调高。文档识别PDF 扫描件直接提取文字场景PDF 是纯扫描件没有文字层或想导出可搜索的双层 PDF。操作打开「文档识别」标签页导入 pdf / xps / epub 文件选输出方式识别提取文本或生成双层可搜索 PDF需要时画忽略区域排除页眉页脚启动任务完成后可设自动关机效果扫描件逐页转为文本双层 PDF 丢进阅读器就能搜索和划选。避坑别先把 PDF 转成图片再识别直接喂 PDF 即可。页数多就打开「完成后自动关机」睡前挂着跑。二维码扫描生成一图多码、19 种协议场景截图里夹着二维码要取内容或快速生成一张二维码图片。操作打开「二维码」标签页拖入图片或粘贴剪贴板图片图中所有码一图多码逐条解析列出生成方向输入文本选协议与纠错等级导出图片效果QR、PDF417、EAN13、Code128 等 19 种协议都支持。避坑码太糊解不出来时先放大重截一张再试。 四、进阶玩法命令行一条指令调用识别命令行入口就是主程序本身前提是全局设置里保持 HTTP 服务开启默认开启仅走本地环回。umi-ocr --path D:/img1.png D:/scans --output result.txt参数说明示例--path单图或文件夹含子目录递归--path D:/scans--output/--结果写入文件覆盖/追加--output r.txt--clip结果复制到剪贴板--clip--screenshot触发截屏识别支持前缀简写--scHTTP API从其他系统调用 OCR 识别默认端口1224全局设置「高级」里可改主机与端口要允许局域网访问把主机切到「任何可用地址」。import requests r requests.post(http://127.0.0.1:1224/api/ocr, json{file_path: D:/test.png}) print(r.json()[data][text])后端并发能力有限串行调用即可偶发ECONNREFUSED重试一次就好。 五、实战工作流开发者代码截图变成能粘进 IDE 的文本输入远程桌面上一张长代码截图。截图OCR 框选代码区域后处理方案选「单栏-保留缩进」记录栏右键「复制全部」粘贴进 IDE缩进、空行都在人工核对个别误识别符号如:和;输出可直接运行的代码文本。下一步截图里夹外语注释时先用批量页导出整份文本再丢给翻译工具。办公一摞合同扫描件导出 Excel输入130 张合同扫描 jpg同一文件夹。批量OCR 标签页选中该文件夹语言选「简体中文」后处理选「多栏-按自然段换行」忽略区域给页底水印位置画一个矩形保存格式选 csv位置选「指定目录」开始任务挂上自动关机过夜跑第二天用 Excel 打开 csv按列筛选入库输出一份包含全部合同文字的表格直接对接 OA 录入。 六、调优与排错参数调优3 个高频参数参数默认值建议值效果限制图像边长960大图/小字调 2880精度上升速度变慢文本后处理方案不做处理多栏-按自然段换行结果可读性明显变好OCR 引擎插件RapidOCR按需换 PaddleOCR速度与精度取舍不同常见问题4 个高频问题启动报错、缺 DLL →原因用了不带运行库的包或系统缺 VC 运行库 →解决用完整版 7z 发布包或补装 Visual C 2015-2022 运行库。问题界面闪烁、UI 错位 →原因显卡硬件加速渲染兼容问题 →解决全局设置「渲染器」切换方案或关闭硬件加速。问题识别准确率低 →原因识别语言模型与图中文字不符或图太糊 →解决设置里换对应语言的模型库同时调高图像边长限制。问题HTTP 接口返回 ECONNREFUSED →原因后端工作线程瞬时繁忙 →解决重新发起请求即可避免高并发调用。 七、生态与资源命令行手册docs/README_CLI.mdHTTP 接口手册docs/http/README.md用户配置文件UmiOCR-data/.settings日志在UmiOCR-data/logs/界面翻译源文件dev-tools/i18n/多语言文档README_en.md、README_ja.md更新日志CHANGE_LOG.md相关生态Umi-OCR 插件库切换 PaddleOCR / RapidOCR 引擎、Weblate 在线翻译协作Umi-OCR 就是那种解压即用、截图批量文档二维码全离线跑完的免费 OCR 工具。现在下载最新 release框个截图试试顺手把快捷方式加到桌面。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表