
Paperless-ngx完整使用指南把纸质文档变成可全文搜索的在线档案【免费下载链接】paperless-ngxA community-supported supercharged document management system: scan, index and archive all your documents项目地址: https://gitcode.com/GitHub_Trending/pa/paperless-ngxPaperless-ngx 是一个社区维护的开源文档管理系统核心功能是扫描OCR、索引和归档你的纸质文档把发票、合同、账单变成可全文检索的在线档案。它适合两类人想给家庭或个人文档去纸质化的技术用户以及需要管理业务文件的小型团队。下面按先跑起来再按场景用的顺序讲解部署和使用方法。核心能力对应场景消费目录自动处理扫描件丢进目录即完成 OCR、索引、归档全文搜索与多维筛选按关键词、标签、日期、对应人快速定位文档工作流自动化新文档进来自动打标签、分配类型和对应人邮件附件抓取配置 IMAP 后自动拉取指定邮箱的附件入库REST API 自定义字段对接自有系统扩展发票号、金额等字段 最短部署路径一条命令跑通装好 Docker 和 Docker Compose 后克隆仓库并运行交互式安装脚本即可。脚本会依次询问数据目录、数据库类型推荐 PostgreSQL、端口然后拉取镜像、启动容器并创建超级用户git clone https://gitcode.com/GitHub_Trending/pa/paperless-ngx cd paperless-ngx bash install-paperless-ngx.sh启动后访问http://127.0.0.1:8000登录。如果你想要手动控制 compose 文件docker/compose/目录下提供了 PostgreSQL、MariaDB、SQLite 三套模板带 Tika 的变体可解析 Office 文档具体步骤见 docs/setup.md。裸机部署面向高级用户不推荐新手。 场景一扫描件入库与全文搜索场景描述你有一批 PDF 或图片格式的扫描文档希望它们自动完成 OCR 并能按内容搜索。操作步骤把文件复制到 consume 目录Docker 部署默认挂载自仓库工作目录下的consume/见 docker/compose/docker-compose.postgres.yml 的挂载配置consumer 服务通过 inotify 监听该目录发现新文件后自动消费执行 OCR、生成缩略图、提取文本处理完成后原件移入 media 目录归档consume 目录清空预期效果几分钟后在界面搜索栏输入文档里的任意词即可命中对应页面。检索基于倒排索引千级文档也能即时返回。️ 场景二用工作流让文档自动分类场景描述入库后文档需要归档到正确的标签、对应人和文档类型下逐份手动编辑不现实。操作步骤进入工作流页面新建触发器trigger选择文档创建时触发配置匹配规则例如包含关键词发票或来自某个邮箱给触发器挂上动作分配标签、指定文档类型、设置对应人、重命名文件等预期效果规则匹配到的文档在处理时就自动完成归档界面按标签浏览时结构清晰后续搜索、统计都更准。复杂条件可以用分支动作进一步细化。 场景三邮件附件自动入库场景描述账单、电子票据经常以邮件附件形式到达手动下载再上传很繁琐。操作步骤配置 IMAP 账户连接支持 OAuth 2.0代码见 src/paperless_mail/oauth.py创建邮件规则指定过滤条件发件人、主题等和要抓取的附件范围规则可指定入库后直接应用的标签、文档类型和对应人预期效果调度器按间隔轮询邮箱新邮件的附件自动走和 consume 目录相同的处理链路全程无需人工介入。⚙️ 关键配置调优三个最影响体验的选项以下配置都写在docker-compose.env或安装脚本生成的.env里完整清单见 docs/configuration.md。1. PAPERLESS_OCR_LANGUAGE —— OCR 语言默认值是eng只识别英文。识别中文文档必须先改否则文本层为空、搜索全部落空PAPERLESS_OCR_LANGUAGEchi_sim # 中英混排可写组合值 PAPERLESS_OCR_LANGUAGEchi_simeng镜像默认只内置英德意西法五种语言中文等额外语言需同时声明PAPERLESS_OCR_LANGUAGESchi_sim才会安装且语言代码里-要写成_如chi_sim。2. USERMAP_UID / USERMAP_GID —— 目录权限默认按容器内 UID 1000 运行。如果宿主机消费目录出现文件放不进去或识别不到把这两个值设成你宿主机用户的id -u/id -g即可。3. PAPERLESS_TIKA_ENABLED —— Office 文档解析默认关闭。要直接索引 .docx、.odt、.pptx 等格式时改为PAPERLESS_TIKA_ENABLEDTrue并使用docker/compose/下带-tika的 compose 文件Tika 会作为独立容器启动。️ 常见坑与排错现象文件放进 consume 目录后没有反应原因NFS 等不支持 inotify 的文件系统收不到目录变更通知或容器内进程无权读取该目录。 解决确认文件系统支持 inotify设置正确的USERMAP_UID/GID或改用定时轮询消费配置项见 docs/setup.md 中 NFS 相关说明。现象OCR 完成后搜索不到内容原因PAPERLESS_OCR_LANGUAGE仍是默认的eng对中文文档提取不出文本层。 解决按上文配置chi_sim重建索引document_index -r管理命令后重试。现象容器启动即退出日志报数据库连接失败原因8000 端口被占用或.env里数据库地址、账号与 compose 文件中不一致。 解决docker compose logs webserver看具体报错换端口修改 ports 映射或对齐数据库配置。现象处理大批量文档时很慢原因OCR 是 CPU 密集型任务多语言模式如chi_simeng耗时更高Redis 任务积压。 解决控制单次投放量扫描尽量用 300DPI 原尺寸纯数字 PDF自带文本层会因auto模式自动跳过 OCR优先直接投放电子原件。现象搜索能命中但预览页显示空白原因文档被识别为损坏或类型不支持缩略图生成失败。 解决用paperless manage系列命令中的 sanity checker 检查文档完整性重新上传可正常打开的源文件。 延伸与集成REST API所有界面操作都有对应 API 端点schema 文档可直接在界面/api/schema/查看docs/api.md 有权限与令牌说明解析器插件支持第三方解析器注册内置日期解析插件示例见 src/documents/plugins/AI 能力可选接 LLM 做文档分类与语义检索源码在 src/paperless_ai/管理命令索引重建、缩略图重生成、文档导入导出等均有manage.py子命令清单见 docs/administration.md社区翻译协作在 Crowdin 进行问题反馈建议走官方仓库 issuePaperless-ngx 的价值在于把扫描-归档-检索这条链路完全自动化让文档存进去之后还能被找到。建议的下一步先挑 10 份真实文档混入 2 份扫描件和 1 份带文本层的 PDF走一遍放入 consume → 自动分类 → 全文搜索的完整流程跑通后再配置邮件规则和工作流。【免费下载链接】paperless-ngxA community-supported supercharged document management system: scan, index and archive all your documents项目地址: https://gitcode.com/GitHub_Trending/pa/paperless-ngx创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考