尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

一条命令让扫描 PDF 可搜索:免费快速的 OCRmyPDF 实战指南

一条命令让扫描 PDF 可搜索:免费快速的 OCRmyPDF 实战指南 一条命令让扫描 PDF 可搜索免费快速的 OCRmyPDF 实战指南【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF你收到一份扫描版 PDF翻遍全文也搜不到一个词复制文字更是无从下手——因为文档里只有图像没有文字。OCRmyPDF 是一款免费开源的命令行工具它为扫描版 PDF 添加 OCR光学字符识别文本层让文档变得可搜索、可复制。 OCRmyPDF 怎么安装macOS 与 Linux 一步到位安装只需一条命令。按你的系统执行下面对应的一行# Debian / Ubuntu apt install ocrmypdf # macOSHomebrew brew install ocrmypdf # Fedora dnf install ocrmypdf tesseract-osd # WindowsWSL 子系统 apt install ocrmypdf装完后运行ocrmypdf --version能看到版本号就说明环境就绪可以直接进入下一步。一条命令把扫描 PDF 变成可搜索文档给它输入文件和输出文件它就开始工作ocrmypdf input.pdf output.pdf它会先扫描每一页识别出文字再把文字精确地铺在原始图像下方。图像一个像素都不改但文字从此可以选中、复制。打开输出文件用 CtrlF 搜一个关键词能命中就算成功。从上面这个终端演示可以看到扫描、识别、优化每个阶段都有进度条。同时注意底部一行——输出文件比输入小了 53.6%因为工具顺手优化了图像、去掉了冗余数据。⚙️ 扫描页歪斜、倒置、有脏点怎么办打印机和扫描仪产出的图像常有毛病轻微倾斜、页面倒放、角落发黑、布满噪点。三个开关各管一件事加在输入文件之前--deskew自动校正倾斜--rotate-pages把倒放或侧放的页面转正--clean去除杂点和背景噪声比如处理一批旧书扫描可以写成ocrmypdf --clean --deskew --rotate-pages input.pdf output.pdf。先修好图像再识别准确率更高。中英文混排文档怎么选识别语言默认识别语言是英语。文档是中文或中英混排时用-l指定例如ocrmypdf -l engchi_sim doc.pdf out.pdf。关键在于语言包默认不随程序附带需要单独装。Linux 上运行apt install tesseract-ocr-chi-simmacOS 上运行brew install tesseract-lang。装好后在-l里写对应代码中文简体是chi_sim。处理一份需要反复引用的旧论文时加上文本层后你才能直接搜术语、把引文复制到笔记里。️ 批量处理扫描 PDF 的方法一个文件夹里有几十个文件时用循环逐个处理mkdir output for f in *.pdf; do ocrmypdf $f output/$f done每个 ocrmypdf 进程会自动使用多个 CPU 核心机器空闲时可以加--jobs 4指定并行核数。更深入的批量与目录树处理方案见批量处理文档。输出太大或文件过大调这两个旋钮扫描件体积想压得更小可以试--optimize 2级别 0–3越高文件越小但处理越慢。超过两百页的合同或标书用--pages 1-100和--pages 101-200分两批跑中途出问题也只损失一批。遇到超大图比如蓝图、大幅面地图--skip-big 50会跳过超过 5000 万像素的页面避免卡死。PDF 里已有文字时怎么 OCRocrmypdf 默认拒绝处理已含文字的文件防止重复识别。三种模式应对不同情况--mode skip只识别纯图像页有文字的页原样保留适合扫描与电子页混排--mode redo剥掉旧文本层再重新识别--mode force整份重新光栅化后从头识别最彻底拿不准就用skip它最保守不会破坏已有内容。️ 语言包缺失或找不到 Tesseract 的报错解决终端底部的报错通常就两类按顺序排查。缺语言包提示语言不支持或缺少 tessdata 时先装语言包。Linux 用apt-cache search tesseract-ocr查全列表再安装对应包macOS 直接brew install tesseract-lang一次装齐。没装 Tesseract 引擎ocrmypdf 依赖 Tesseract 做识别找不到引擎就先装它Debian 系apt install tesseract-ocrmacOSbrew install tesseract。排查时也可以先跑ocrmypdf --help这是核对所有可用开关最快的方式。更多细节以官方文档为准。接下来可以做的 4 件事手边找一份扫描版 PDF跑ocrmypdf input.pdf output.pdf用 CtrlF 确认文本层生效用上面的 for 循环处理一个文件夹的文档对比输入输出体积对一份歪斜的旧扫描试一次--deskew --clean肉眼对比前后差异想往流程里加自己的步骤时浏览内置插件目录找参考【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表