尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

免费离线文字识别完整指南:如何把截图、图片和PDF扫描件变成可编辑文本

免费离线文字识别完整指南:如何把截图、图片和PDF扫描件变成可编辑文本 免费离线文字识别完整指南如何把截图、图片和PDF扫描件变成可编辑文本【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR还在为PDF扫描件复制不了文字、截图里的文字要逐字手打而头疼Umi-OCR 是一款开源免费的离线文字识别软件解压即用、断网可用能把截图、图片和PDF一键转成可编辑文本——这正是很多人苦苦寻找的图片转文字免费工具。它的思路很简单所有识别都在你本机完成图片不用上传到任何服务器敏感资料留在自己手里没有次数限制、没有水印、没有会员墙。接下来这份指南会按先上手、再提效、后定制的顺序带你把它用成日常工作的常驻助手。为什么你需要的是一台不上网的识别引擎先想一个问题你平时怎么复制图片里的文字多半是打开某个在线识别网站传图、等待、复制结果。这套流程有三个隐忧隐私图片可能是合同、病历、聊天记录要上传到对方服务器数据流向不可控限制免费版通常限次数、限大小识别慢了要排队断网就完全瘫痪批量能力弱一次传一张是常态遇到几十上百张图就只能在网页和文件夹之间反复横跳。Umi-OCR 的解法是把 OCR 引擎整个搬进本地。它内置了 Rapid-OCR 和 Paddle-OCR 两套离线引擎识别时 CPU 直接干活网络只用来下载软件本身。免费、开源、无广告Windows 7 以上和 Linux x64 都能跑。对比项在线识别网页Umi-OCR网络依赖必须联网上传完全离线运行图片隐私上传至对方服务器数据始终留在本机使用成本限次或付费开源免费无次数限制批量处理通常单张操作一次可导入数百张输出格式多为纯文本TXT / JSONL / MD / CSV 可选除了取字它还顺手把扫码、生成二维码、PDF 转文本也打包了进来一个软件覆盖你大部分从图片到文字的需求。三步起步解压、双击、开始识别Umi-OCR 是绿色软件不需要安装向导也不往注册表写东西。拿到的发布包有两种形态.7z压缩包以及给没装压缩软件的用户准备的自解压版.7z.exe后者双击即可自动解压。拉取仓库拿到完整项目git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR在仓库中找到Umi-OCR_Rapid_v2.1.5.7z解压到任意目录Windows 下双击Umi-OCR.exeLinux 下运行umi-ocr.sh。首次启动时软件会读取你系统的语言设置自动切换到对应语言的界面之后想手动调整随时可以在设置里改。程序的配置集中在UmiOCR-data/目录下配置文件.settings就是全部状态换个电脑拷贝这个目录就能带走你的设置。上手第一课把屏幕上的文字抠出来日常最高频的场景就是把屏幕上不可复制的文字变成文本。Umi-OCR 的截屏取字功能把这条链路压缩到了几秒钟打开主界面的截屏取字页按下你设置的全局快捷键唤起截图的快捷键可以自定义屏幕出现取景框拖拽框选目标区域松开鼠标即自动开始识别识别结果出现在右侧记录面板按CtrlC直接复制双击可编辑修正右键还能调出复制图片、删除记录等更多操作。如果你手里已经有一张图片不用截图——直接在别处复制图片回到软件里粘贴就能识别把图片文件拖进窗口也同样有效。识别出的文本可以按 TXT、JSONL、MD 等格式存盘方便归档或喂给其他工具。一次扔进几百张图下班前收结果当任务从一张图变成一批图时逐个截图就太浪费时间了。批量识别页就是为这种场景准备的导入点「选择图片」或直接把文件拖进列表区支持 JPG、PNG、WebP、BMP、TIF/TIFF 等常见格式规模没有数量上限几百张图可以一次性入队每张显示耗时和状态产出识别完成后导出为 TXT、JSONL、MD 或 CSVCSV 可直接用 Excel 打开做表格善后长任务跑完可以自动关机或待机晚上挂着跑、早上来收结果。遇到像素特别大的长图或高清大图识别可能超时或报错。别慌在页面的「文字识别→限制图像边长」里把数值调高即可。扫描版PDF从只可远观到全文可搜纸质材料扫描成的 PDF本质上是图片的集合里面的字既不能选也搜不到。Umi-OCR 的文档识别功能可以逐页提取文字输出两种结果纯文本整本 PDF 变成一个可以编辑、搜索、复制的文本文件双层可搜索 PDF保留原图画面同时在底层嵌入文字层——看起来还是那份扫描件但里面的字能选中、能检索。支持的输入格式不止 PDF还包括 XPS、EPUB、MOBI、FB2、CBZ 等常见电子书格式。处理整本书时同样可以设置忽略区域来剔除页眉页脚跑完自动关机。水印、页眉与页脚用一块忽略区域挡住干扰批量识别最烦人的不是图片多而是图片上带着水印、LOGO 或页眉页脚。这些干扰文字混进识别结果里既碍眼又要手动删。Umi-OCR 为此设计了忽略区域在批量识别页的设置里进入忽略区域编辑器按住右键在图片上拖出若干矩形框把这些框圈起来的区域划为禁识区任务运行时框内文字会被直接跳过。需要注意一个细节被忽略的是整个文本块而不是单个字符。所以画框时尽量画大一点把水印可能出现的位置完全包住框外的正常文字不受影响依旧照常识别。识别结果乱序排版解析帮你复原阅读顺序很多 OCR 工具能认出字却理不顺句——遇到双栏排版、竖排文字或图文混排输出顺序经常乱套。Umi-OCR 内置了排版解析方案在识别后自动整理文本顺序和换行逻辑多栏自动识别多栏布局按自然段换行 / 强制换行 / 合并到一行三种粒度可选单栏适合普通段落排版同样提供换行与合并选项保留缩进专门为代码截图设计保留行首缩进和行中空格识别出来的代码能直接粘贴使用。这些方案对横排和竖排从右到左都有效竖排书页、漫画台词这类场景也能应对。如果你追求引擎的原始输出也可以选择不做处理。把它调成顺手的样子语言、主题与显示修复工具顺手不顺手很大程度上取决于细节。全局设置页里集中了这些调节项快捷方式与开机自启一键把 Umi-OCR 加到桌面、开始菜单或开机自启列表常驻后台随时待命界面语言软件界面支持简体中文、繁体中文、英文、日文等多国语言首次启动自动匹配系统语言也可手动切换主题与字体内置多套亮色/暗色主题字号和字体都能按你的屏幕习惯调整渲染器界面默认走显卡加速渲染。如果你的机器出现截屏闪烁、UI 错位之类的问题在「界面和外观→渲染器」里换一种方案或关闭硬件加速即可解决。识别语种方面软件内置中、英、日、韩等常见语言的识别库开箱即用更小众的语言可以通过安装额外语言包来扩展。多语言界面由社区译者协作维护翻译进度和新增语种都在持续更新中。进阶玩法命令行与HTTP接口把识别能力装进你的脚本如果你不只是想点鼠标Umi-OCR 还开放了命令行和 HTTP 两套外部调用入口主程序Umi-OCR.exe本身就是命令行入口。几个高频指令umi-ocr --screenshot # 唤起鼠标截屏识别 umi-ocr --path D:/图片 # 识别指定路径下的所有图片含子文件夹 umi-ocr --clipboard # 识别剪贴板中的图片 umi-ocr --show # 弹出主窗口命令行依赖本地 HTTP 服务进行进程间通信默认开启主机选仅本地即可。这个通信只在系统内部的环回地址进行不经过物理网卡不会把数据泄露到外部。另外.settings配置可以手动编辑改完用umi-ocr --reload重新加载无需重启软件。HTTP 接口覆盖图片识别、PDF 识别、二维码识别与生成等能力详细参数见docs/http/目录下的接口文档命令行完整手册在docs/README_CLI.md。想换识别引擎的话还可以通过UmiOCR-data/plugins插件目录随时切换或扩展不同 OCR 引擎。开发者拿到这些接口等于把一个离线识别服务装进了自己的工具箱。五个最容易踩的坑一次讲清新手用这类工具问题往往集中在几个点上大图报错——像素超大的长图识别失败去「限制图像边长」把数值调高截屏闪烁或界面错位——多半是显卡渲染兼容问题切换渲染器或关闭硬件加速识别速度不理想——在全局设置里切换 OCR 插件不同引擎对不同场景的速度差异明显竖排文字识别不出——需要 OCR 引擎本身支持竖排并确保对应语言包已安装改了配置不生效——检查是否保存或使用umi-ocr --reload重载配置文件。动手试试十分钟换回以后无数个十分钟把 Umi-OCR 放进工作流收益是立竿见影的PDF 扫描件变成可搜索文本几百张图一次入队批量出结果水印和页眉自动被忽略代码截图识别出来直接可用。它免费、开源、完全离线数据不出本机用起来没有任何心理负担。现在花十分钟把它跑起来clone 仓库、解压、设好截图快捷键然后随便找一张含文字的图片试一试。你会很快发现那些曾经靠手打才能解决的文字提取任务从此按几个键就能完成。如果软件有不符合预期的地方也可以查阅CHANGE_LOG.md了解最新改动——项目仍在持续迭代新的能力会不断加入。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表