
BabelDOC PDF 双语翻译实操指南三步拿到保留版式的双语 PDF【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOCBabelDOC 是一个 PDF 文档翻译工具把论文或报告交给它它会翻译每一页的文本然后生成一份双语对照 PDF原文与译文并排和一份纯译文 PDF。公式、表格、插图都留在原来的位置不需要你手动搬运到 Word 里。装好命令行工具跑一条命令就能出结果。它到底能做什么一份原文 PDF换回两份译文 PDF答案很简单默认情况下BabelDOC 一次跑完会给你两份 PDF。第一份是双语对照版同一页内原文和译文并排放置适合边看边对照。第二份是单语译文版只保留翻译后的内容。不想要的版本用--no-dual或--no-mono关掉其中一个即可。对科研读者来说最关键的是公式处理BabelDOC 在解析阶段会识别出公式区域翻译时把公式当作整体跳过所以Emc²这类内容不会被翻译成乱码表格和图像的位置也不会漂移。需要提醒的是项目 README 里列了几条已知问题作者和参考文献区域可能合并成一段、不支持首字下沉、特别大的页面会被跳过。用之前心里有数遇到这些情况不用怀疑是自己操作错了。用 uv 三步装好 BabelDOC 并完成首次翻译第一步安装并验证官方推荐用 uv 安装工具环境和你的日常环境互相隔离uv tool install --python 3.12 BabelDOC babeldoc --help--help能正常打印参数列表就说明装好了。也可以不走 PyPI克隆仓库https://gitcode.com/GitHub_Trending/ba/BabelDOC后在项目目录里用uv run babeldoc运行。第二步和第三步接上翻译服务跑一条命令BabelDOC 目前只接OpenAI 兼容的 LLM 接口。官方 OpenAI、第三方中转网关、本地的 Ollama 都行区别只在 base-url 和 key 怎么填本地模型随便填个占位值也能跑。babeldoc --openai --openai-model gpt-4o-mini \ --openai-base-url https://api.openai.com/v1 \ --openai-api-key your-api-key-here \ --files paper.pdf跑完后输出目录里会多出两份 PDF长这样多个文件就重复传--files--output或-o可以指定输出目录不指定就落在当前目录。语言和输出参数速查控制双语 PDF 的长相这一节回答我怎么控制输出常用的都是命令行参数一张表列清楚。参数作用--lang-in/--lang-out源语言 / 目标语言默认en→zh--pages只翻译指定页格式如1,3-5、1-,-3--no-dual/--no-mono不输出双语版 / 不输出单语版--dual-translate-first双语 PDF 中译文页排在原文页前面默认原文在前--use-alternating-pages-dual双语版改为原文页、译文页交替排列而不是同页并排--watermark-output-mode水印模式watermarked默认、no_watermark、both两种都输出关于语言范围要泼一点冷水官方语言表列了一百多种语言代码但 README 明确说当前主要打磨的是英文到中文其他方向能用但未充分测试。完整清单看 支持的语言列表。大 PDF 和扫描件的两个实战技巧这一节解决两个高频麻烦大文档翻译中途失败、扫描版 PDF 翻出来一坨字。大文档分页翻译和兼容性增强--max-pages-per-part 50每 50 页切一段逐段翻译后自动合并。一段失败不用整份重来。--enhance-compatibility一键打开一组兼容性选项等价于--skip-clean--dual-translate-first--disable-rich-text-translate。某些 PDF 阅读器打开输出文件乱码时先试这个代价是--skip-clean会让文件体积变大。--qps默认 4和--pool-max-workers控制请求速率和线程数。API 限流宽松就把 qps 调高翻译会明显变快。翻译缓存默认开启重复段落直接复用结果加--ignore-cache可强制重新翻译。参数太多时可以写成 TOML 配置文件用--config 文件路径一次性传入。扫描版 PDF自动检测加 OCR 兜底扫描件里是图片而不是文本直接翻会得到空结果。BabelDOC 会自动检测文档是否以扫描页为主确认自己手头不是扫描件时可以加--skip-scanned-detection省掉检测时间。--ocr-workaround在译文下方垫白色色块盖住原文并把译文强制为黑色。只适合白底黑字的文档。--auto-enable-ocr-workaround检测到扫描占比很高时自动启用上面的处理方式不用你手动判断。术语表与离线资产把翻译调得更可控这一节回答两个进阶问题专业名词怎么固定译法断网环境怎么跑用 CSV 术语表固定译法传一个 CSV 给--glossary-files文件包含三列source原文词条、target译文词条、tgt_lng可选指定该条目生效的目标语言如zh-CN。比如一行AutoML,自动ML,zh-CN翻译到中文时 AutoML 就会被固定译成自动ML。命中词条时对应术语表会自动附进发给模型的提示词要求译文遵守。另外翻译前默认会先做一轮自动术语抽取--no-auto-extract-glossary可以关掉--save-auto-extracted-glossary能把抽取结果存成 CSV方便你审阅后改造成正式术语表。离线资产包断网环境的一次性准备模型和字体默认联网下载。断网部署时先在有网的机器上生成离线资产包再带到目标机器解压babeldoc --generate-offline-assets ./offline babeldoc --restore-offline-assets ./offline/offline_assets_*.zip包内资产带 SHA3-256 校验文件名里编码了清单哈希所以不能改名--restore-offline-assets也可以直接传目录工具会自动找到正确的包。想深入看解析、段落切分、翻译、排版各环节的实现细节可以从 官方文档 和 翻译模块源码 入手。【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考