ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

BabelDOC 上手指南:把英文 PDF 翻译成保留原排版的中文双语 PDF

BabelDOC 上手指南:把英文 PDF 翻译成保留原排版的中文双语 PDF BabelDOC 上手指南把英文 PDF 翻译成保留原排版的中文双语 PDF【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOCBabelDOC 是一个开源的 PDF 翻译库调用 OpenAI 兼容的大模型把论文、技术文档等 PDF 翻译成中文同时保留原有排版、公式与表格位置输出双语对照和纯译文两种 PDF。适合需要长期阅读英文文献、且希望译文拿起来就能看的用户。了解 BabelDOC 能做什么翻译走解析 → 翻译 → 重排版三步先解析 PDF 得到文本块、公式和表格的结构再交给 LLM 翻译最后按原排版重建一份新 PDF公式和图不会被翻掉。几个关键事实默认一次产出两个文件双语对照的 dual PDF 和纯译文的 mono PDF用--no-dual或--no-mono可关掉其中一种。翻译引擎只接 OpenAI 兼容 API含自建服务、Ollama 本地模型--openai-model默认是gpt-4o-mini。项目当前主力场景是英译中--lang-in默认en--lang-out默认zh其余语言代码对照 docs/supported_languages.md 自行确认。安装 BabelDOC 并验证环境BabelDOC 要求 Python ≥3.10 且 3.14推荐用 uv 装一条命令即可uv tool install --python 3.12 BabelDOC看到Installed ... executable: babeldoc即安装成功。接着验证babeldoc --help能列出完整参数说明就算环境就绪。这步失败多数是网络原因重跑一次即可反复失败可强制重装uv tool install --python 3.12 BabelDOC --force-reinstall如果需要改代码或跟开发版就从源码装git clone https://gitcode.com/GitHub_Trending/ba/BabelDOC cd BabelDOC uv run babeldoc --help装好后命令前缀换成uv run babeldoc用法完全一样。用命令行翻译第一个 PDF核心参数只有一个--files加上翻译服务的三件套babeldoc --files example.pdf \ --openai \ --openai-model gpt-4o-mini \ --openai-base-url https://api.openai.com/v1 \ --openai-api-key your-api-key-here多个文件重复写--files即可例如--files a.pdf --files b.pdf。跑完后在当前目录或--output指定的目录出现两份以原文件命名的 PDF一份左右双语对照一份纯译文。看到进度条走完并生成文件就是成功如果报 401先检查 API key 和 base-url 是否配套。key 不是官方 OpenAI 的话把--openai-base-url指向自己的服务即可Ollama 这类本地服务的 key 随便填一个值。配置翻译参数与术语表日常最常用的几个参数babeldoc --files example.pdf \ --pages 1-10 \ --lang-in en --lang-out zh \ --glossary-files terms.csv \ --output ./out--pages只翻指定页写法如1,3-5大文档分段翻译更稳。--max-pages-per-part 50超过 50 页自动切块翻译再合并适合超长论文。--glossary-files加载 CSV 术语表列名为source、target可选tgt_lng仓库里有个样例 docs/example/demo_glossary.csv照这个格式填自己的术语。参数多了可以写一份 TOML 配置文件用--config传入例如openai true、qps 10、output /path/to/dirREADME 里有完整模板。排查翻译失败与排版问题 排障按先看日志再开兼容模式的顺序来--debug开启调试日志并把中间结果导出到~/.cache/babeldoc/working排查段落错乱时直接看这里的产物。--warmup只下载和校验模型、字体后退出。断网环境下建议先在有网机器跑一次再用--generate-offline-assets打离线包到目标机器--restore-offline-assets恢复。输出 PDF 在某些阅读器里显示异常时先整体开--enhance-compatibility等价于跳过 PDF 清理、译文页在前、禁用富文本翻译。已知限制横线、首字下沉不支持超大页面会被跳过作者与参考文献区可能合并成一段。具体实现细节可以看 ImplementationDetails。完整参数表和 Python API 说明见仓库 README问题可以直接到社区提 Issue 讨论。【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表