尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Umi-OCR完全指南:免费离线OCR软件如何把屏幕上的文字“搬“下来

Umi-OCR完全指南:免费离线OCR软件如何把屏幕上的文字“搬“下来 Umi-OCR完全指南免费离线OCR软件如何把屏幕上的文字搬下来【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR你有没有遇到过这样的时刻网页上的文字被加了水印鼠标根本选不中老师发的PPT截图里全是重点却只能一个字一个字地敲几百页的扫描版PDF想检索里面的内容却像在翻纸书。复制粘贴失灵的时候这些看得见、摸不着的文字就变成了最磨人的存在。Umi-OCR 就是为解决这类问题而生的免费、开源、离线OCR软件把截图、图片、PDF扫描件里的文字识别出来变成可以编辑、复制、搜索的文本全程不需要联网也绝不把你的文档上传到任何服务器。这篇 Umi-OCR 教程会从实际任务出发带你一步步把它的能力用起来。任务一先把软件跑起来——免安装的离线OCR工具怎么用很多工具在安装这一步就能劝退新手。Umi-OCR 的设计恰恰相反它没有安装程序。从仓库克隆项目git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR找到压缩包Umi-OCR_Rapid_v2.1.5.7z解压到任意文件夹Windows 双击Umi-OCR.exeLinux 运行umi-ocr.sh没有注册、没有引导向导、没有下一步下一步。解压即用离线运行这也是离线OCR软件这个名字的真正含义识别引擎全部内置断网状态下也能正常干活。首次启动后界面语言会自动跟随你的系统设置稍后在全局设置里可以随时切换。 提示如果你电脑上没有压缩软件可以去找自解压版本.7z.exe双击就能自动完成解压连压缩软件都省了。任务二屏幕上的文字复制不走截图OCR三秒搞定这是 Umi-OCR 使用频率最高的场景看到一段重要内容却发现它既不是文本、也禁止复制。此时不需要任何打开软件的操作——按一下截图快捷键就行。截图OCR快捷键默认是CtrlAltZ按下后屏幕进入取景模式拖动鼠标框住目标区域松开鼠标识别即刻开始结果自动出现在右侧记录栏CtrlC直接带走识别出的文字还能继续加工直接在记录栏里修改错字、划选多条记录合并复制、一键导出为 TXT/JSONL/MD 等格式。甚至你在别处复制了一张图片粘贴进来也能立刻识别不必每次都走截图流程。为什么识别结果经常读起来不通顺试试排版解析OCR 的难点不只是认字还有排版。杂志上的多栏文章、带缩进的代码截图、从右往左的竖排文字——如果按原始坐标生硬输出句子顺序往往是乱的。Umi-OCR 内置了文本后处理-排版解析方案相当于给识别结果做了一次智能排版多栏-按自然段换行自动识别多栏布局按阅读顺序输出适合大多数场景单栏-保留缩进专门用于代码截图保留行首缩进与空格不做处理输出 OCR 引擎的原始结果遇到识别出来了但读着别扭的情况优先检查这里选的是不是合适方案。横排、竖排文字都能处理竖排还需识别引擎支持对应语言。任务三上百张图片要转成文字一张张截屏会崩溃如果手里是几十上百张图片——比如书籍扫描页、聊天记录截图、网课板书——用截图OCR一张张来显然不现实。这时该轮到批量OCR登场。操作非常直白在「批量OCR」标签页把图片拖进左侧列表点「开始任务」即可。支持 JPG、PNG、WebP、BMP、TIFF 等常见格式一次导入几百张没有数量上限进度条会实时显示每张图的识别状态与置信度。真正让批量OCR好用的是下面两个细节输出格式任选结果可保存为 TXT、JSONL适合程序处理、MD、CSVExcel 直接打开忽略区域批量识别带水印或页眉页脚的图片时在编辑器里按住右键画几个矩形框框住干扰位置任务中这些区域内的文字会被自动排除识别结果干净许多 提示如果识别超长截图失败可以在页面「设置→文字识别」里调高限制图像边长的数值。任务四扫描版PDF怎么变成可搜索文档这是很多人的隐藏需求资料只有扫描版 PDF既不能选中也不能检索需要时只能一页页翻。Umi-OCR 的文档识别功能专门解决这个问题。在批量页面点「选择文件」导入 PDF 后启动任务软件会自动逐页识别。更妙的是它支持输出双层可搜索PDF上层是原始扫描图片外观不变下层是识别出的文本层。成品既保留了原版观感又能被搜索、复制、划词翻译。支持pdf, xps, epub, mobi, fb2, cbz等多种文档格式还能配合忽略区域排除页眉页脚。如果任务特别长可以勾选完成后自动关机/休眠睡前挂机醒来取结果。附带任务扫码和生成二维码Umi-OCR也能干既然要处理图片Umi-OCR 顺手把二维码功能也做全了扫码截图或拖入图片自动识别其中的二维码、条形码支持一图多码生成码输入文本一键生成二维码图片可自定义大小支持 QRCode、DataMatrix、PDF417 等 19 种编码协议。日常需要给链接、Wi-Fi 密码做码时不用再打开网页版生成器了。把工具调教成自己的形状界面、语言与快捷键识别工具用久了总会希望它更顺手。Umi-OCR 的「全局设置」能覆盖大多数个性化需求。界面语言简体中文、繁体中文、英语、日语等可一键切换首次启动自动跟随系统主题多个浅色/深色主题还有禁用美化效果选项快捷键截图、重复上次截图等快捷键都能改把高频动作绑到自己顺手的按键上渲染器如果出现截屏闪烁或界面错位去「界面和外观→渲染器」切换渲染方案或关闭硬件加速多语言这一点尤其值得多说一句——它不光是界面语言识别引擎本身也内置了多国语言库中英日韩等50语言开箱即用这对经常处理外文资料的人来说是实打实的效率提升。进阶玩法用命令行和HTTP接口遥控OCR如果你不满足于点鼠标Umi-OCR 还向开发者敞开了大门——这也是很多OCR软件做不到的地方。命令行直接调用主程序即可例如umi-ocr --screenshot # 截屏并识别 umi-ocr --path D:/images # 识别整个文件夹里的图片 umi-ocr --qrcode_read D:/code.png # 识别二维码配合--output参数可以把结果直接写入文件适合写脚本批量处理。完整用法见 docs/README_CLI.md。HTTP接口则允许其他程序调用 OCR 能力图片识别、文档识别、二维码识别与生成都有对应的 API接口文档在 docs/http/README.md。这就意味着你完全可以把 Umi-OCR 当成一个本地 OCR 服务嵌入自己的自动化流程或小工具里。 提示命令行与 HTTP 接口默认开启通信仅在系统内部的本地环回进行不经过物理网卡数据不会离开你的电脑。收个尾下次遇到复制不了时先想起它从复制不了到随时能提取Umi-OCR 的价值其实就一句话把只读的文字世界变成你可编辑的文字资产。它免费、开源、离线可用截图、批量、PDF、二维码一条龙甚至还能被脚本调用。下一次再遇到看得见摸不着的文字不必急着截图发给在线OCR网站——打开 Umi-OCR按一下CtrlAltZ就够了。等你把命令行和 HTTP 接口玩熟或许还能琢磨出更有意思的用法比如把截图OCR串进自己的笔记流程或者给家里的扫描仪配一个自动转文字管道。工具是死的用法是活的剩下的交给你的想象力。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表