尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Umi-OCR 批量图片文字识别完整指南:免费离线 OCR 工具怎么用

Umi-OCR 批量图片文字识别完整指南:免费离线 OCR 工具怎么用 Umi-OCR 批量图片文字识别完整指南免费离线 OCR 工具怎么用【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款开源、免费的离线 OCR光学字符识别即把图片里的文字提取成可编辑文本软件。它把识别引擎直接打包进程序截屏、图片、PDF 文档都在本地处理不依赖网络也不上传任何文件。界面由可自由开关的标签页组成覆盖截图识别、批量识别、PDF 文档识别和二维码四大场景。一、这些情况下可以用 Umi-OCR处理本地图片库手里有几十、几百张截图或照片需要转文字手动复制粘贴不现实批量识别更合适。扫描件和 PDF 电子化有扫描版 PDF、EPUB、MOBI 等文档想提取文本或转成可搜索的 PDF。对隐私敏感的工作合同、票据、内部资料不方便上传到云端 OCR 网站需要完全本地处理。日常快速取字看网页、读电子书时想复制某段文字用快捷键截图识别比找复制框更快。扫描或生成二维码图片里有条形码、二维码要读取内容或需要把一段文本生成二维码图片。二、三分钟完成下载与首次启动Umi-OCR 无需安装发布包是.7z压缩包或.7z.exe自解压包解压后直接双击Umi-OCR.exe即可运行适用于 Windows 7 及以上 x64 系统和 Linux x64 系统。也可以从仓库内已有的 Umi-OCR_Rapid_v2.1.5.7z 发布包直接获取Rapid 引擎版兼容性好。首次启动时软件会按系统语言自动选择界面语言。首页就是截图OCR和全局设置两个默认标签页左侧竖排图标可以唤起截图和粘贴图片右侧记录栏存放识别结果。如果后续需要批量处理点击标签栏的号从模板里打开批量OCR文档识别等页面即可用不到的标签页可以直接关掉界面保持简洁。三、四个核心标签页导览截图OCR键盘截图就地取字这是默认打开的页面。按快捷键唤起截图划选区域后文字即刻识别出来。左侧图片预览栏可以直接用鼠标划选文字复制右侧记录栏支持编辑、合并、划选多条记录一起复制也支持从别处复制图片后直接粘贴进来识别。右侧设置面板里的文本后处理排版解析是这个页面的关键它负责把零散的文本块按阅读顺序重新组织。预设方案包括多栏-按自然段换行、单栏-保留缩进等均能自动适配横排和从右到左的竖排文字。批量OCR一次导入几百张图这一页用于把本地图片批量转成文字。支持jpg, jpe, jpeg, jfif, png, webp, bmp, tif, tiff格式没有数量上限。左侧列表显示每张图的耗时与置信度右侧记录栏按文件名分组输出识别结果。识别完成后可保存为txt, jsonl, md, csv(Excel)四种格式还支持任务结束后自动关机或待机。它有一个截图页没有的特殊功能——忽略区域按住右键在图上画若干矩形框框内的整个文本块会被排除在结果之外专门用来去掉水印、页眉页脚。文档识别PDF 扫描件提取文本支持pdf, xps, epub, mobi, fb2, cbz等格式。对扫描件跑 OCR或直接提取文档里已有的文本层最终可输出为双层可搜索 PDF文字层藏在图片底下既能看原文也能全文搜索。同样支持忽略区域和任务完成后自动关机。二维码识别与生成截图、粘贴或拖入本地图片即可读取其中的二维码和条形码支持一图多码和 19 种码制。反过来输入一段文本还能生成二维码图片可指定纠错等级和输出尺寸。四、把一次批量识别从头走到尾导入图片打开批量OCR标签页点击左栏选择图片在文件对话框里多选需要处理的文件。几百张图一次全放进左侧列表也没有问题确认数量无误后继续。调整参数在右栏设置面板检查三项识别语言按图片内容选择后处理方案按文档类型选普通单栏文档用单栏-按自然段换行代码截图用单栏-保留缩进多栏论文用多栏-按自然段换行如果这批图都带固定位置的水印进入忽略区域编辑器用右键把水印区域全部框住。图片特别大或特别长时把限制图像边长的数值调高避免被压缩。启动任务点击开始任务顶部进度条会显示已处理张数、耗时和百分比每张图的置信度0~1 之间的质量评分实时出现在左侧列表。任务完成前可以中断中途取消不影响已识别的部分。导出结果完成后在记录栏查看文本然后保存单张图各存一个文件或全部合并到一个文件里。格式在 txt、jsonl、md、csv(Excel) 之间任选csv 可以直接用 Excel 打开做二次整理。五、场景参数速查表场景关键操作推荐设置预期结果多栏论文扫描文档识别页导入 PDF多栏-按自然段换行按阅读顺序还原栏序的文本代码截图批量OCR导入图片单栏-保留缩进语言选英文保留行首缩进的源码文本带水印的图片组批量OCR 忽略区域编辑器右键框住水印位置结果中不含水印文字扫描件转可搜索 PDF文档识别页输出双层 PDF可全文检索的 PDF 文件快速取一段网页文字截图OCR标签页默认方案识别后划选复制文字进入剪贴板批量图片转 Excel批量OCR保存输出格式选 csv可直接编辑的表格文件六、常见问题命令行执行识别时不弹出主窗口怎么回事命令行任务默认沿用截图OCR标签页的设置如果那里勾选了弹出主窗口就会弹出来取消勾选即可。另外命令行依赖 HTTP 服务请确认全局设置里该服务处于开启状态。图片很大或是很长的长图识别报错或很慢到页面设置里把限制图像边长调高。这个参数决定了引擎处理前会把图片缩放到多长默认值对超大图偏保守。识别结果里总混着水印文字用忽略区域功能。注意它忽略的单位是整个文本块而不是单个字符矩形框要画得足够大把水印可能出现的所有位置都包住。界面出现截屏闪烁、UI 错位在全局设置 → 界面和外观 → 渲染器里切换到其他渲染方案或关闭硬件加速试试这是显卡加速渲染在个别机型上的兼容问题。识别出来的顺序不对多栏文档乱了基本是后处理方案选错了多栏布局要用多栏-开头的方案它会自动识别栏位再按自然段排序。七、进阶命令行与 HTTP 接口Umi-OCR 把图形界面背后同一套能力暴露给了脚本。命令行入口就是Umi-OCR.exe或 Linux 下的umi-ocr常用指令如--screenshot截图识别、--path 路径识别指定图片或整个文件夹、--qrcode_create生成二维码结果可用--clip复制到剪贴板或--output写入文件。完整参数见 命令行手册。HTTP 接口则方便把 OCR 能力嵌进自己的程序图片 Base64 识别、PDF 文档识别、二维码识别与生成都有独立接口文档详见 HTTP 接口手册 及 api_ocr.md、api_doc.md。界面本地化方面软件内置简体中文、繁体中文、英语、日语、俄语等多种界面语言在全局设置页即可切换也可以参考 dev-tools/i18n/ 里的翻译工具包参与补充新语言。Umi-OCR 的思路很直接把截图取字、批量转文、文档电子化这三件事都做进一个无需联网的本地程序里。如果你正有一批图片或扫描件等着转文字先解压启动软件从批量OCR标签页导一个小文件夹试跑一次就能快速确认它的识别质量是否符合你的要求。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表