尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

BabelDOC:一条命令产出双语 PDF 的开源翻译工具

BabelDOC:一条命令产出双语 PDF 的开源翻译工具 BabelDOC一条命令产出双语 PDF 的开源翻译工具【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC翻一篇论文 PDF机器翻译出来的版式全乱、公式没了、表格散了这种情况你大概率遇到过。BabelDOC 是一个开源 PDF 翻译工具先把文档结构解析出来再交给大模型翻译最后重新排版渲染产出中英对照版和纯译文版两份 PDF版式和公式基本留在原处。它会替谁省事平时你一篇篇手工对照英文论文它直接把整份 PDF 翻成双语对照公式和图表还待在原位。平时你靠人肉检查术语译得对不对它直接按你给的术语表强制统一译法。平时你要自己封装翻译流程它本身就是按可嵌入其他程序的 Python 库设计的。BabelDOC 的四项核心能力1. 版式保留的翻译流程。不是简单替换文字而是把 PDF 解析成结构化中间表示翻译后重新渲染。跑一次任务默认同时输出双语对照 PDF 和单语翻译 PDF用--no-dual/--no-mono可以只留其中一份。2. 术语表控制。用--glossary-files加载 CSV列是source、target、可选tgt_lng译文段里命中术语时对应术语表会直接塞进提示词约束模型。自动术语提取默认开启加--no-auto-extract-glossary可关掉。3. 大文档分块翻译。--max-pages-per-part指定每块页数翻译完自动合并回一份文件避免一次性处理撑爆内存。4. 扫描件兜底。扫描版 PDF 用--ocr-workaround会在译文下垫白色块盖住原文、文字强制变黑不想手动判断就用--auto-enable-ocr-workaround让系统自己检测。⚡ 5 分钟上手装完就跑出结果推荐用 uv 安装uv tool install --python 3.12 BabelDOC配好 OpenAI 兼容接口后翻第一份 PDFbabeldoc --openai --openai-model gpt-4o-mini \ --openai-base-url https://api.openai.com/v1 --openai-api-key 你的key \ --files example.pdf结束后当前目录或--output指定的目录会多出双语 PDF 和单语 PDF。默认英译中要改方向就加--lang-in和--lang-out。 三个实战场景学术英文论文。一份带图表公式的 10 页 IEEE 论文babeldoc --openai --openai-model gpt-4o-mini --openai-base-url https://api.openai.com/v1 --openai-api-key 你的key --files paper.pdf --pages 1-10产出中英对照 PDF图注和公式位置不变可以直接逐段对照阅读。带术语的企业技术文档。先把术语整理成glossary.csv三列source,target,tgt_lng翻译时带上--glossary-files glossary.csv产出整篇术语统一的译文 PDF。300 页以上的操作手册。加--max-pages-per-part 50分块跑产出自动合并好的双语 PDF中途某块失败也不用从头再来。 老手的踩坑提醒文档过 200 页时记得挂--max-pages-per-part不然内存容易先于模型成为瓶颈。某个阅读器里排版发怪先加--enhance-compatibility它等价于同时打开--skip-clean、--dual-translate-first、--disable-rich-text-translate。确认不是扫描件却想快一点加--skip-scanned-detection省掉一轮检测。--ocr-workaround只适合白底黑字的扫描版彩色背景别硬上。觉得翻得慢先看--qps默认 4想推翻旧结果重翻用--ignore-cache。❓ 常见疑问支持哪些语言主力是英译中其他方向参考 docs/supported_languages.md 的语言表依赖连写字的语言支持度会打折扣。能接本地模型吗可以只要是 OpenAI 兼容接口如 Ollama、vLLMbase URL 和 key 指过去即可本地服务时 API key 填a之类的占位值都行。输出文件带水印怎么办默认带水印--watermark-output-mode设no_watermark或both切换。想看懂内部机制去哪看docs/ImplementationDetails/ 按解析、段落识别、排版等环节分了文档examples/ 里有结构示例可对照。 结语BabelDOC 最趁手的就是英文论文翻成中文、版式别乱这件事术语表、分块、扫描件兜底都给了开关。拿一份难啃的 PDF 实测前先翻一遍 README 的 Known Issues 一节再去 docs/ImplementationDetails/ 看流水线各环节的实现卡住了也知道该从哪段代码查起。【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表