尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Umi-OCR 完整指南:如何在 Linux 上配置离线文字识别

Umi-OCR 完整指南:如何在 Linux 上配置离线文字识别 Umi-OCR 完整指南如何在 Linux 上配置离线文字识别【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR刚截了一张带字的图想直接把它变成可编辑的文本或者手头有一整个文件夹的扫描图片想一次性全部转出文字Umi-OCR 就是为这类需求准备的开源、免费的 Linux 离线文字识别工具解压即用、不依赖网络截图识别、批量 OCR、PDF 文档识别、二维码扫描与生成全部在本地完成。适合对数据隐私有要求或者单纯不想把图片传到云端的你。一、完成环境准备从压缩包到桌面快捷方式这一节做完以后点一下图标就能启动不用再打开终端敲命令。下载发行版压缩包.7z格式解压到一个不含中文路径的目录建议/opt/Umi-OCR。软件是绿色便携的解压即完成部署无需安装。给启动脚本加执行权限并在终端首次运行确认界面正常弹出chmod x /opt/Umi-OCR/umi-ocr.sh /opt/Umi-OCR/umi-ocr.shLinux 版要求 glibc 2.31 及以上Debian 11、Ubuntu 20.04 之后的主流发行版都能直接跑。首次启动会按系统语言自动选择界面语言如果界面没弹出来直接在终端运行脚本就能看到报错v2.1.5 以上版本还会把日志写到UmiOCR-data/logs目录方便排查。软件主界面是标签页布局截图 OCR、批量 OCR、文档识别、二维码等功能按需开页互不干扰创建桌面快捷方式新建文件~/.local/share/applications/umi-ocr.desktop写入以下内容再执行update-desktop-database ~/.local/share/applications刷新Umi-OCR 就会出现在应用菜单里[Desktop Entry] TypeApplication NameUmi-OCR Comment开源离线OCR文字识别工具 Exec/opt/Umi-OCR/umi-ocr.sh Terminalfalse CategoriesUtility;Office;Graphics;想固定到桌面的话把同样的文件存到桌面目录即可。另外全局设置标签页的“快捷方式”区域也能管理桌面、开始菜单、开机自启这几项开关。二、截图识别实战一张图快速拿到文字这是使用频率最高的功能打开“截图OCR”标签页用快捷键唤起截图、划选区域右侧就能得到识别结果。打开截图OCR标签页点左侧工具栏的截图按钮开始划选按Esc可随时取消。识别完成后在左侧图片预览区直接鼠标划选文字块复制右侧“记录”栏保留历史结果可以编辑、跨记录多选复制。在浏览器、即时聊天工具里复制的图片也可以直接粘贴进软件识别效果等同于命令行的--clipboard指令。为代码和表格选择排版解析方案原始 OCR 输出常常语序混乱。“文本后处理”里的排版解析方案就是干这个的按内容类型选一个即可多栏-按自然段换行适合大多数文章自动识别多栏布局、按自然段换行。单栏-保留缩进适合代码截图保留行首缩进和行内空格代码结构原样保留。不做处理输出引擎原始结果留给需要自行微调的场景。比如一张 Python 代码块的截图选“单栏-保留缩进”后识别结果会保持缩进和换行粘贴进编辑器就能直接用横排、竖排从右到左的排版顺序也都由方案自动整理。三、批量 OCR把整批图片导出为 txt 和 Markdown几十上百张图片要处理时切到“批量OCR”标签页点击“选择图片”或直接拖入文件夹支持jpg、jpeg、png、webp、bmp、tiff等格式图片数量没有上限。在右侧设置里选择保存目录和文件类型可选txt、jsonl、mdMarkdown、csvExcel 可直接打开。点击“开始任务”进度条、每张图耗时和置信度都会实时显示完成后每张图对应一份识别结果文件。两个实用细节识别超大图或长图之前先到“页面设置 → 文字识别 → 限制图像边长”调高数值否则大图会被压缩处理影响识别效果。图片上有固定水印或页眉页脚时进入“忽略区域”编辑器按住右键拖出多个矩形框完全位于框内的文本块会被跳过水印就不会污染结果。任务跑完还能设置自动关机/待机适合挂机批量。四、个性化与效率增强语言切换、别名和自动化切换界面语言软件内置多国语言库简中、繁中、英语、日语、俄语、葡萄牙语等。首次启动跟随系统语言之后随时在“全局设置 → 语言/Language”里手动切换重启软件生效给终端设置识别别名经常待在终端的话往~/.bashrc或~/.zshrc里加两行别名一行命令就能发起识别alias ocr/opt/Umi-OCR/umi-ocr.sh alias ocr-clip/opt/Umi-OCR/umi-ocr.sh --screenshot --clipsource生效后ocr-clip就是“截图并直接把结果放进剪贴板”。指令集远不止这些范围截屏、二维码识别/生成都有对应参数完整清单见 命令行手册如果想从脚本或本地服务里发起识别HTTP 接口手册 里也给出了 Base64 调用的方式。一行命令跑完整个文件夹批量自动化其实不需要自己写循环--path参数直接传文件夹路径软件会自动搜索其中所有图片含子文件夹并输出识别结果/opt/Umi-OCR/umi-ocr.sh --path /path/to/images --output /path/to/result.txt如果要求每张图单独存一个文件用批量OCR标签页勾选 txt/Markdown 格式导出更省事。五、性能调优与常见故障排查性能建议大批量识别大图最耗资源建议分批导入或调高“限制图像边长”控制单张处理量。界面默认走显卡加速渲染若出现截屏闪烁、UI 错位到“界面和外观 → 渲染器”切换渲染方案或关闭硬件加速。软件内置 RapidOCR、PaddleOCR 两类离线引擎插件速度和准确率各有取舍可在全局设置里按文档类型切换。只保留当前要用的标签页每个页面都持有独立的工作状态。常见故障点图标没反应确认umi-ocr.sh有执行权限在终端手动运行一次看报错v2.1.5 起可查UmiOCR-data/logs里的日志定位问题。识别准确率不理想换一版 OCR 引擎试试代码、表格、多栏文档记得选对应排版解析方案固定水印用忽略区域排除。批量任务太慢减少单批图片数量检查“限制图像边长”是否设得过高保证内存充足。备份与迁移配置你的所有设置主题、语言、快捷键、识别参数等都保存在安装目录下的UmiOCR-data/.settings文件里是 ini 格式。升级或换机器前把整个Umi-OCR目录含UmiOCR-data子目录拷走即可手动改过配置文件后还可以用--reload指令热加载不必重启软件。Umi-OCR 把截图、图片批量、文档扫描这三类识别场景收进一个界面全部离线完成配置也能整目录带走。对办公、学习、档案数字化场景以及想搭本地自动化识别流水线的用户来说它是目前 Linux 上很少见的全能型离线 OCR 选择——按上面的步骤配好一次之后每次识别都只需要一个快捷键。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表