尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

PDF论文翻译完整指南:PDFMathTranslate 配置与个性化实战

PDF论文翻译完整指南:PDFMathTranslate 配置与个性化实战 PDF论文翻译完整指南PDFMathTranslate 配置与个性化实战【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate当你要翻译一篇满是公式、图表和跨栏排版的论文又不想翻译后版式全乱时PDFMathTranslate 就是为这个场景做的它在保留原版排版的前提下做全文双语翻译一次产出纯译文版和对照版两种文件。本文带你从第一条命令走到可以离线使用的本地模型翻译服务。先认清产出物翻译完你会得到什么执行一次翻译后当前目录会生成两个文件论文名-mono.pdf纯译文版和论文名-dual.pdf原文与译文逐页对照。前者适合精读后者适合边查原文边读。上图为翻译进行时的实时预览效果公式和图表位置均未被移动。下面两张图是同一份文档翻译前后的对照翻译前英文原文公式与图表完整。翻译后文字已替换为中文版式、公式、图注位置与原文一一对应。3 分钟完成第一次翻译前置条件只有一个Python 3.11 到 3.12。pip install pdf2zh pdf2zh document.pdf到这一步不需要任何配置文件。默认使用 Google 翻译服务源语言英文、目标语言中文4 个线程并发译文直接写回原 PDF 的文本层。如果你不想敲命令加一个-i即可启动图形界面浏览器打开http://localhost:7860/pdf2zh -i上图为 GUI 操作界面拖入文件、选服务、点翻译即可。配置文件位置、格式与核心开关所有配置集中在一个 JSON 文件里路径固定为~/.config/PDFMathTranslate/config.json首次运行会自动创建不需要手动建。如果你有专门的配置用--config指向它对 CLI 和 GUI 都有效pdf2zh document.pdf --config /path/to/config.json优先级上有一个容易踩的坑环境变量会覆盖文件里的值并自动写回文件见 pdf2zh/config.py 中get的逻辑。所以我明明改了配置却没生效多半是同名环境变量还在起作用。常用开关如下开关作用默认值与建议PDF2ZH_LANG_FROM / PDF2ZH_LANG_TO源语言 / 目标语言English / Simplified ChineseUSE_MODELSCOPE是否走 ModelScope 下载布局模型国内网络可设为 1NOTO_FONT_PATH中文输出字体路径Docker 内为 /app/SourceHanSerifCN-Regular.ttfENABLED_SERVICESGUI 中只允许使用哪些服务自建服务时用于收窄选项HIDDEN_GRADIO_DETAILS隐藏界面里真实的 API Key对外提供服务时建议 true配置的核心是translators数组每个元素对应一个翻译服务。一份典型配置{ PDF2ZH_LANG_FROM: English, PDF2ZH_LANG_TO: Simplified Chinese, translators: [ { name: openai, envs: { OPENAI_BASE_URL: https://api.openai.com/v1, OPENAI_API_KEY: sk-xxxx, OPENAI_MODEL: gpt-4o-mini } }, { name: ollama, envs: { OLLAMA_HOST: http://127.0.0.1:11434, OLLAMA_MODEL: gemma2 } } ] }两个最实用的翻译服务接法云端 APIOpenAI 兼容接口大多数大模型厂商都兼容 OpenAI 接口改一下OPENAI_BASE_URL就能换后端。命令里可以用-s 服务名:模型名直接指定模型覆盖配置里的默认值pdf2zh paper.pdf -s openai:gpt-4o-mini⚠️ 注意BASE_URL必须以/v1结尾否则会出现 404 错误。各服务的完整环境变量表见 docs/ADVANCED.md。离线服务本地 Ollama 模型不想把论文发到云端时在 pdf2zh/translator.py 里找 OllamaTranslator 可以看到默认值本机http://127.0.0.1:11434模型gemma2。配好上面的 JSON 后pdf2zh paper.pdf -s ollama本地模型翻译会明显慢于云端服务但文档完全不出内网适合涉密或无网环境。缓存与速度调优翻译过的段落会被存进缓存SQLite 数据库位于~/.cache/pdf2zh/cache.v1.db见 pdf2zh/cache.py。再次翻译包含相同段落的文档时直接命中缓存、不再请求服务重复任务能省掉大部分等待时间。缓存按引擎 参数 原文三元组去重换模型后不会误用旧译文。几个提速开关-t 8提高并发线程数默认 4云端 API 建议调到 8 左右本地模型保持 1~2。-p 1先只翻第 1 页做试译确认效果后再跑全文。--ignore-cache强制重新翻译改过提示词或怀疑译文质量时使用。--prompt prompt.txt给 LLM 类服务自定义提示词模板里可用${lang_in}、${lang_out}、${text}三个变量。--mode precise切换到 v2 翻译内核实验特性对跨栏、跨页的一致性处理更好。排错速查配置不生效先确认没有同名环境变量覆盖优先级高于文件再检查 JSON 是否合法--config尽量用绝对路径。OpenAI 兼容接口报 404BASE_URL缺/v1后缀补上即可。布局模型下载失败国内网络set HF_ENDPOINThttps://hf-mirror.com输出文件在个别阅读器里乱码加--compatible先转 PDF/A字体相关异常可加--skip-subset-fonts跳过字体子集化。译文里公式标记被破坏这是 LLM 采样不稳定导致的Ollama/Xinference 默认temperature0已规避换用--prompt时注意保留原文中的公式占位符说明。下一步先用pdf2zh paper.pdf -p 1 -s ollama试译一页确认本地模型可用再把整批文档目录用pdf2zh --dir ./papers/ -s ollama批量跑掉。如果打算把服务分享给团队补上ENABLED_SERVICES和HIDDEN_GRADIO_DETAILS两项再启动 GUI 即可。【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表