尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Umi-OCR 实战指南:3个场景带你用免费离线OCR工具搞定文字识别

Umi-OCR 实战指南:3个场景带你用免费离线OCR工具搞定文字识别 Umi-OCR 实战指南3个场景带你用免费离线OCR工具搞定文字识别【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费、开源的离线OCR工具解压即用不联网。截图识别文字、批量识别图片、PDF扫描件文字提取全部在你自己的电脑上本地完成。这篇指南按 3 个最实用的场景带你上手。先认识一下 Umi-OCR离线OCR界面总览Umi-OCR 无需安装。Windows 上解压后双击Umi-OCR.exeLinux 上执行umi-ocr.sh主窗口就打开了。主窗口由一组标签页组成你按需打开截图OCR框选屏幕区域识别文字结果即时可编辑、可复制批量OCR拖入一个文件夹的图片成百上千张一起跑文档识别读取 PDF 等扫描件提取文本或生成双层可搜索PDF二维码扫二维码和生成二维码都能做全局设置语言、主题、OCR引擎、快捷键等全局参数界面首次启动会跟随系统语言支持简体中文、英语、日语等之后可在「全局设置」里手动切换。三步把截图里的代码变回可复制文本你在看 API 文档、读报错信息时常常想把屏幕上的代码直接拷走手动敲既慢又容易错。打开「截图OCR」标签页点左上角的截图图标进入框选模式拖框圈住代码区域按Esc可取消如果图片已经在剪贴板里直接粘贴到这一页也能识别在右侧「设置」里把「排版解析方案」选成单栏-保留缩进结果出现在右侧「记录」区用鼠标划选文字CtrlC复制走关键参数参数取值什么时候用排版解析方案单栏-保留缩进代码截图保留行首缩进和行中空格排版解析方案多栏-按自然段换行默认值普通文档自动按自然段换行排版解析方案不做处理引擎原始输出每行一段你会得到什么识别记录可以逐条编辑也能划选多条记录一起复制配合「结果复制到剪贴板」选项识别完文字直接进剪贴板。批量图片转文本一次性处理几百张扫描件档案管理员、财务把一沓纸扫描成图片后一张张点着认根本不现实。切到「批量OCR」标签页点「选择图片」或直接把图片文件夹拖进列表支持 jpg、png、webp、bmp、tif 等格式没有数量上限在右侧「设置」栏勾选保存格式txt、jsonl、md、csv(Excel)和保存目录图片上有固定水印或页眉页脚进入忽略区域编辑器按住右键拖出几个矩形框把水印可能出现的位置都包进去点「开始任务」看着进度条跑完关键参数参数常见选择说明保存文件格式txt / jsonl / md / csvcsv 可直接用 Excel 打开忽略区域右键画框只有整个落在框内的文本块会被忽略所以框要画大一点限制图像边长960 → 2880像素超大的长图调高避免被压缩导致模糊任务完成后自动关机/待机晚上挂机跑完顺手关机你会得到什么每张图片对应一个文本文件右侧「记录」栏随时可回看任意一张的结果。用命令行和HTTP接口把OCR集成进自动化 进阶内容。想让识别跟着脚本自动跑不用手动点界面有两条路命令行和 HTTP 接口。打开「全局设置」确认已允许HTTP 服务默认开启主机选「仅本地」即可默认端口1224命令行入口Linux 用umi-ocrWindows 用Umi-OCR.exe两条最常用的命令umi-ocr --screenshot --clip umi-ocr --path D:/images -- results.txt第一条鼠标截屏并把识别结果复制到剪贴板第二条识别整个文件夹结果写入文件。HTTP 方式则是向POST http://127.0.0.1:1224/api/ocr发送图片的 Base64 编码参数里加data.format: text就返回纯文本返回码100表示成功、101表示图中无文本。完整字段见 HTTP接口手册 和 图片识别接口。配置速查引擎与关键参数怎么选参数可选值建议OCR引擎PaddleOCR / RapidOCRPaddle 精度更高、语言库更全Rapid 兼容性更好。在「全局设置 → 切换OCR插件」里换限制图像边长960 / 2880 / 4320 / 无限制默认 960 求快大图小字调到 2880 求准纠正文本方向开 / 关图片倾斜或倒置时开速度会稍降语言/模型库简体中文、English、日本語、한국어、Русский 等必须和图片主体语言匹配英文文档选models/config_en.txt界面语言 / 主题多国语言亮/暗主题「全局设置 → 界面和外观」里调多国语言界面切换效果常见问题排查识别不准、速度慢怎么办识别结果模糊、漏字→ 原因图像边长限制太低被压缩或语言库选错 → 处理把「限制图像边长」调到2880语言库换成和图片匹配的那项。水印、页眉混进结果里→ 原因没画忽略区域 → 处理批量OCR的忽略区域编辑器里右键画框盖住框宁大勿小。命令行敲了没反应→ 原因HTTP 服务没开启 → 处理到「全局设置」确认 HTTP 服务已允许默认开启。HTTP 接口连续调用时偶发连接报错→ 原因后端对并发和长时间连续调用支持有限 → 处理直接重新发起请求即可后台任务不会受影响。截图时界面闪烁、UI错位→ 原因显卡加速渲染的兼容问题 → 处理在「全局设置 → 界面和外观」里切换「渲染器」方案。写在最后Umi-OCR 一个工具覆盖截图OCR、批量识别、PDF文档识别、二维码四件事全程离线、完全免费。命令行手册HTTP接口手册更新日志配置文件路径UmiOCR-data/.settingsini 格式界面改的参数都存在这里可手动修改后用umi-ocr --reload重载【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表