尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

如何保留公式与排版做 PDF 翻译:PDFMathTranslate 快速上手

如何保留公式与排版做 PDF 翻译:PDFMathTranslate 快速上手 如何保留公式与排版做 PDF 翻译PDFMathTranslate 快速上手【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate拿到一篇 40 页的英文论文公式占了一半复制粘贴进翻译软件全是乱码PDFMathTranslate命令行名 pdf2zh干的就是 PDF 翻译 保留公式这件事——全文翻译科学论文输出时保持原版式的布局。为什么它能翻译科学 PDF 而不弄坏公式它不是把整页文字抽出来逐字丢给翻译引擎而是先给页面拍一张X 光片内置版面模型把 PDF 的每个区域分成文字、公式、图片、表格、目录、页眉页脚只把文字区域送去翻译。先做版面检测分清哪里是文字哪里是公式首次运行会自动下载 DocLayout-YOLO 版面模型逐页定位公式、图表、目录和注释的位置。公式和图片根本不进翻译流程所以数学符号和编号原样保留。只动文字输入、处理、输出的完整链路一份 PDF 进去先分区域文字送翻译服务默认 Google无需配置密钥译文再写回原来的文字框。输入一次会生成两份产物document-mono.pdf是纯译文document-dual.pdf是中英对照版。边界纯图片扫描件要先 OCR它解析的是 PDF 文本层纯图片扫描版无法直接翻译需要先装 OCR 附加包或自行 OCR见 README.md 的实验性 OCR 一节。三步翻译你的第一份 PDF确认你的 Python 版本在 3.11 到 3.12 之间然后用一条命令装好pip install pdf2zh装成功后你会得到一个全新的pdf2zh命令。接着进入 PDF 所在目录执行pdf2zh document.pdf跑完你会看到当前目录多了两个文件document-mono.pdf纯译文和document-dual.pdf双语对照双栏、公式编号和页眉页脚与原文逐页一致。首次运行稍慢因为要下载版面模型。全部参数清单见 docs/ADVANCED.md。按场景拆功能四种常见需求只翻译几页核对内容只想快速看摘要和结论时加-p指定页码范围其余页保持原样pdf2zh example.pdf -p 1-3,5成功后只有第 1、2、3、5 页被翻译。这个场景常配合的参数参数作用-p仅翻译指定页码-li/-lo源语言 / 目标语言-t并发翻译线程数--ignore-cache跳过缓存强制重新翻译批量翻译整个文献文件夹一次消化一整个文件夹的文献时用--dir指向目录用-o指定结果落盘位置pdf2zh --dir /path/to/papers -o results成功后 results 目录里每个 PDF 都会生成对应的 mono 和 dual 两份文件。切换翻译服务Google 默认质量不满意时用-s换服务但要先设好环境变量DeepL 需要DEEPL_AUTH_KEY服务密钥OpenAI 兼容接口需要OPENAI_API_KEY和OPENAI_BASE_URLpdf2zh example.pdf -s openai:gpt-4o-mini跑起来后就用指定模型完成翻译。各服务环境变量对照表见 docs/ADVANCED.md 的 Translate with different services 一节。不想敲命令行一条命令启动 Web 图形界面拖入文件、配置服务、在浏览器里实时预览译文pdf2zh -i随后打开 http://localhost:7860/ 即可使用容器部署只需拉取byaidu/pdf2zh镜像并映射 7860 端口另外pdf2zh --mcp还能把翻译能力作为 MCP 服务提供给 Claude Desktop。细节见 docs/README_GUI.md。踩坑速查如果首次运行下载版面模型失败 → 大概率是网络到不了模型源 → 把HF_ENDPOINT环境变量指向镜像地址见 README.md 的网络问题说明如果 PDF 提不出任何文字、翻译没输出 → 它是纯图片扫描件、没有文本层 → 安装 OCR 附加包pip install pdf2zh[ocr]或先自行 OCR如果公式或代码被翻译成了乱码 → 那个字体没进默认保留列表 → 用-f追加字体名正则写法见 docs/ADVANCED.md 的 Translate with exceptions 一节如果同一份文件重跑还是旧译文 → 翻译缓存命中、跳过了 API 调用 → 加--ignore-cache强制重新翻译接下来做两件事打开 docs/ADVANCED.md 的 Full / partial translation 一节把-p和--dir组合起来批量翻几页重点内容。对照同文档 Translate with different services 一节的环境变量表配一套 DeepL 或 Ollama 本地模型跑一次对比默认 Google 的译文质量。【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表