
BabelDOC PDF 翻译工具指南英文 PDF 转中文且保留排版【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOCBabelDOC 是一款开源 PDF 翻译工具。它把英文 PDF 翻译成中文保留原版式、公式与字体样式输出单语版和双语对照版两份文件。适合要把论文、技术手册读成中文、又不想排版错乱的人。翻译结果不打乱排版你拿到一份 200 页的英文论文要中文版但版式不能乱。把文字复制到在线翻译第一页看着还行公式变成乱码表格结构散了翻到第十页就没人能读。丢给大模型 API 也一样回来的是一串纯文本没有任何排版。BabelDOC 的思路是先把 PDF 解析成结构化中间表示找出段落和样式信息把文本交给大模型翻译再把译文重新排版回原来的文字区域。得到的仍是一份 PDF页边距、分栏位置不变公式原样保留。扫描件同理它能检测扫描页并切换到 OCR 处理路径。常用功能速览双语对照与公式保留双语对照阅读你想边读边对照原文。它默认输出左右并排的双语 PDF文件名以.dual.pdf结尾只要单语版就加--no-dual。公式与样式保持你希望公式和字体层级原样不动。它按字体、字符模式识别公式文本并跳过翻译译文排版继承原字号、字重和颜色。术语统一你希望同一术语全文译法一致。可传 CSV 术语表source、target、tgt_lng 三列另有内置的自动术语提取示例见 docs/example/demo_glossary.csv。大文档分块你担心 300 页的 PDF 撑爆内存。它可按页数切分、分块翻译后自动合并回完整文档。五分钟安装并翻译第一份 PDF安装命令行工具需先装好 uvuv tool install --python 3.12 BabelDOC babeldoc --help跑第一次翻译babeldoc --files paper.pdf --lang-in en --lang-out zh \ --openai --openai-model gpt-4o-mini \ --openai-base-url https://api.openai.com/v1 --openai-api-key your-api-key--files输入的 PDF 文件可重复传多次实现批量翻译--lang-in/--lang-out源语言与目标语言默认 en 到 zh--openai-*任何 OpenAI 兼容 API 都行本地 Ollama 也可以key 随便填个占位值结果默认和输入文件同目录paper.zh.mono.pdf是中文版paper.zh.dual.pdf是双语对照版用--output可改输出目录。完整参数在 README.md。想从源码跑克隆仓库 后进入目录uv run babeldoc用法相同。CLI、API 与自部署用法选型方式适合谁特点命令行开发者、自动化流程参数全部暴露为命令行参数适合批量处理可写进脚本Python API集成进自己的产品项目声明 API 为内部接口推荐经由 pdf2zh next 的high_level.do_translate_async_stream调用在线服务普通用户免安装、免配置有免费额度轻量使用足够自部署企业、数据敏感场景配合开源项目 pdf2zh next 拉起 WebUI可接更多翻译服务 进阶参数与常见问题 FAQ进阶技巧大文档分块--max-pages-per-part 50按 50 页自动分段翻译并合并内存占用平稳。控并发与限速--qps限制对翻译服务的请求频率默认 4--pool-max-workers直接设置内部任务线程数。扫描文档--ocr-workaround在译文下补白色背景盖住原文仅适合黑字白底--auto-enable-ocr-workaround则在检测到扫描页后自动启用。一行示例babeldoc --files large.pdf --max-pages-per-part 50 --qps 10常见问题问支持哪些翻译服务 答任意 OpenAI 兼容端点。--openai-base-url填地址、--openai-api-key填密钥本地 Ollama 的 key 填占位字符串即可。问结果输出到哪里 答默认与输入文件同目录--output可指定目录。生成单语版.mono.pdf和双语版.dual.pdf两个文件。问重复翻译会不会重复消耗 API 答不会。内置翻译缓存相同文本直接复用--ignore-cache可强制重新翻译。问某些 PDF 阅读器打不开输出文件 答加--enhance-compatibility它会一次性开启跳过清理、译文在前、禁用富文本翻译三项兼容设置。问出错了怎么排查 答加--debug详细日志和中间结果会导出到~/.cache/babeldoc/working。关键目录与排错速查babeldoc/format/pdf/document_il/解析、翻译、排版的中间语言流水线babeldoc/translator/翻译服务与缓存babeldoc/docvision/文档布局分析模型babeldoc/pdfminer/PDF 解析基础docs/ImplementationDetails/各阶段实现细节文档问题原因解法翻译速度慢文档大或网络请求多--max-pages-per-part分块 --qps限速公式识别错误特殊字体或编码--formular-font-pattern指定公式字体扫描 PDF 效果差纯图片无文字层--ocr-workaround或--auto-enable-ocr-workaround输出文件打不开阅读器兼容性问题--enhance-compatibility内存不足一次处理页数过多调小--max-pages-per-part并用--working-dir指定工作目录如果你主要做英文论文和手册的中文化又在意版式保真BabelDOC 这个 PDF 翻译工具能覆盖多数场景。全部参数见 README.md中间语言设计见 docs/README.md。【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考