
pdf-inspector3 行代码在本地跑通 PDF 分类与文本提取【免费下载链接】pdf-inspectorFast Rust library for PDF inspection, classification, and text extraction. Intelligently detects scanned vs text-based PDFs to enable smart routing decisions.项目地址: https://gitcode.com/GitHub_Trending/pdf/pdf-inspector拿到一份 PDF你很难一眼分清它是不是文本型——上不上 OCR 全凭感觉猜错就白烧算力还可能把响应拖到几十秒。pdf-inspector 是 Rust 写的本地 PDF 分类与文本提取库10-50ms 判类型、200ms 内抽完文本型全程不碰任何外部服务。pip 一行装好3 行出结果Python 版的预编译 wheel 覆盖 Linux、macOS、Windows装完直接import就能跑无需 Rust 工具链pip install pdf-inspectorimport pdf_inspector r pdf_inspector.process_pdf(doc.pdf) print(r.pdf_type, r.markdown)Node.jsfirecrawl/pdf-inspector、浏览器 WASM、Rust crate 和 CLI 工具pdf2md也都有对应入口按你的运行时挑一条即可。跑通上面三行后看看它到底能替你干什么。它能替你做什么分类、抽 Markdown、拿坐标判类型10-50msprocess_pdf顺带返回pdf_typetext_based/scanned/image_based/mixed、0-1 的confidence以及pages_needing_ocr这个逐页该走 OCR 的页码列表。意味着你不用等用户盯着上传的加载动画——趁这几十毫秒就能把本地抽还是送 OCR的分流策略定下来连哪几页要补 OCR 都提前知道。文本型本地抽成 Markdown200ms 内标题分级、列表、等宽字体识别出的代码块、表格、URL 转链接直接产出干净 Markdown。在 200 份文档的 opendataloader-bench 语料上它整体得分 0.875、表格TEDS0.814完整跑完 200 份只要 0.470s是五个被测引擎里最快的。而据项目口径约 54% 的 PDF 本不需要 OCR——这部分你根本不用为它们付 OCR 的钱。带坐标的文本项extract_text_with_positions给出每段文字的 X/Y 坐标、字号、是否加粗/斜体。意味着做高亮、点击定位、或按位置切片喂给 RAG 时坐标和样式是现成的不用自己反推版面。基础调用之外还有一个高频场景值得知道。进阶一瞥按页码抽 拿坐标要拿到每段文字的位置信息喂给下游高亮、定位、RAG 切片时用带坐标的抽取pages参数顺带限定只看哪几页items pdf_inspector.extract_text_with_positions(doc.pdf, pages[0, 2]) for it in items[:5]: print(f{it.text} ({it.x:.0f},{it.y:.0f}) size{it.font_size})pages是 0 起始的页码列表返回的每个item都带text / x / y / font_size / is_bold可直接对接高亮或切片逻辑。想继续深入这几个入口直接可用。下一步查完整 API → docs/python.mdNode 绑定 → napi/README.md浏览器跑 → wasm/README.md看基准数据 → docs/benchmarking.md挑一份你手头的 PDF跑一遍detect_pdf看看它判得准不准。【免费下载链接】pdf-inspectorFast Rust library for PDF inspection, classification, and text extraction. Intelligently detects scanned vs text-based PDFs to enable smart routing decisions.项目地址: https://gitcode.com/GitHub_Trending/pdf/pdf-inspector创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考