TBL:整本英文书丢给 AI 翻译,EPUB 排版和目录居然还能保住
而是翻译完一打开:目录没了,标题层级乱了,斜体、脚注、段落样式全挤成一锅粥。几百页内容,翻译可能只花一会儿,重新排版能把人送走。
最近翻到 TBL,也就是 Translate Books with LLMs。它最抓我的地方没那么玄乎,就一个:文件进去什么结构,翻译出来尽量还是什么结构。
EPUB 的章节、样式和目录会保留;SRT 字幕的时间轴不会因为翻译被重新打散;Word 文档也不用先拆成纯文本再一段段塞给模型。当前主要支持 EPUB、SRT、DOCX 和 TXT,项目称长篇内容会自动切块处理,并在分段之间保留上下文。
别小看字幕时间轴这个点。
普通聊天工具翻字幕,经常把两句话合并,或者顺手改掉序号。文字看着是通顺了,往播放器里一塞,人物嘴都说完了,字幕才慢悠悠冒出来。TBL 是保留原始时间戳,只动里面的文本。看课程、访谈和外语视频的人,应该懂这能省多少脏活。
模型这块也没绑死。DeepSeek、Gemini、OpenAI 这些云端接口可以接,想让原文留在自己电脑上,也能走 Ollama 或其他 OpenAI 兼容接口。老鬼看这种工具一般先想的不是“支持多少模型”,而是换模型要不要重写一圈代码。这里基本就是选 Provider、填 Key 或改接口地址,链路比较直。
还有个很现实的设计:断点续译。
翻几百页小说,最怕跑到凌晨撞上限流、网络断开,第二天发现得从第一页重新烧 Token。TBL 会自动保存检查点,中断后可以接着上次进度继续。长任务里,这功能比多支持几个模型实在得多。
不过先别急着把所有文件往里扔。PDF 目前并不在核心支持列表里,带扫描页、复杂表格的文档也不能想当然指望它原样搞定;项目 issue 里仍有人在提 PDF OCR 支持。另外,长篇翻译最终质量还是看模型、提示词和术语一致性,格式保住了,不代表小说人物名一定从头到尾不漂。
好在它给 Windows 和 macOS 做了打包版本,不想装 Python、配环境的,解压运行后在浏览器里操作就行。
手里有英文原版书、外语字幕,或者几十上百页 Word 资料的,可以先拿一小章试试。对我来说,TBL 最值钱的不是“AI 翻译”四个字,而是翻完以后,不用再从目录和时间轴开始收拾残局。
GitHub地址:hydropix/TranslateBooksWithLLMs