尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

断网环境安装 OCRmyPDF 完整指南:把扫描件批量转成可搜索 PDF

断网环境安装 OCRmyPDF 完整指南:把扫描件批量转成可搜索 PDF 断网环境安装 OCRmyPDF 完整指南把扫描件批量转成可搜索 PDF【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF机房、船载终端、内网服务器——机器连不上外网手里却压着一摞扫描件想检索一个词都要翻半天。OCRmyPDF 离线流程可以解决这件事在有网的地方备齐四个组件拷进隔离网络环境装好之后每台机器都能独立给扫描件生成文本层输出可搜索、可复制的 PDF。出发前的一次性清单在有网机器上备齐这四样之后每个断网环境都能反复使用不用再碰外网组件最低版本说明Python3.10当前发布按 3.11 构建建议直接装 3.11 或更新Ghostscript9.54负责 PDF 渲染与输出Tesseract OCR4.1.1识别引擎本体OCRmyPDF 本体最新版 wheel 或源码依赖上列三项协同工作注意语言训练数据是单独下发的把需要的.traineddata文件英文eng、简体中文chi_sim等一并拷进 U 盘这是离线环境里最常被漏掉的一件。Linux / Windows / macOS 断网安装 OCRmyPDF 速查Linux 断网安装Debian 系先下载后 dpkg在联网的同架构机器上把依赖拉成.debapt-get download ocrmypdf ghostscript tesseract-ocr python3拷到断网机器后安装缺的残留依赖顺手补上dpkg -i *.deb apt-get install -fFedora 系把两条命令换成dnf download与rpm -ivh *.rpm即可。Windows 断网安装四个安装包按序落地Python、Ghostscript、Tesseract 各自有独立安装包在联网机上存下来按 Python → Ghostscript → Tesseract 的顺序装到断网机上。OCRmyPDF 本体装离线 wheelpip install ocrmypdf-*.whlmacOS 断网安装联网机备料U 盘带走联网机上先让 Homebrew 把依赖缓存下来brew install --download-only ocrmypdf ghostscript tesseract把缓存的 bottle 文件和 OCRmyPDF 的 wheel 一起拷进 U 盘再在断网机上安装。注意 macOS 上 Homebrew 严格来说只能离线装一部分最稳妥的做法还是整机换机或走内网源。落地自检3 分钟确认断网机器能跑跑ocrmypdf --version它能同时核对 Python、Ghostscript、Tesseract 三个外部依赖的版本是否达标报错就先修哪条。确认语言包文件真的落盘Linux 的 tessdata 目录是/usr/share/tesseract-ocr/4.00/tessdata/Windows 是C:\Program Files\Tesseract-OCR\tessdata\目录里能看到eng.traineddata才算齐。最小运行命令拿一张扫描件试跑ocrmypdf tests/resources/typewriter.pdf tests/resources/out.pdf产物里能选中文本整条链路就算通了。参数速查离线 OCR 最常用的六个选项选项作用什么时候用--language指定识别语言如eng chi_sim混排文档必配缺了识别结果全是乱码--skip-text跳过已有文本的页面文档只有一部分是扫描件时省时间--clean对扫描图像做预处理扫描件噪点多、底色发灰识别率上不去时--output-type指定输出类型需要长期存档就用pdfa--optimize优化等级 0–3输出体积要压下来时调高代价是耗时--pages只处理指定页码文件大或只想补识别某几页批量与自动化一个循环搞定一整目录for f in *.pdf; do ocrmypdf $f ocr_$f; done需要固定一套参数时写个配置文件再用--config指过去不必每次敲全命令行文件会持续丢进某个目录的话仓库里的 misc/watcher.py 可以监听目录、新文件进来自动触发识别。卡住了怎么办错误原因处理动作启动即报依赖缺失或版本不达标Ghostscript / Tesseract 没装好或版本太低按ocrmypdf --version的提示重装对应组件Tesseract couldnt find a language data file语言包没拷进 tessdata 目录把.traineddata放进上文 Linux / Windows 两个路径之一再重跑处理大文件时内存不足、进程被杀整份 PDF 一次性渲染撑爆内存用--pages分批处理或给机器加交换空间更多参数细节和排错思路见仓库里的 docs/introduction.md 与 docs/errors.md。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表