独立开花卓富贵

我用 7 个 AI 翻译了同一段话:翻译质量有区别吗?

Image

最近刚好读到一篇不错的文章《The Lost Art of Research as Leisure》,这篇文章谈了阅读和写作塑造文化。现代社会中,阅读的碎片化和肤浅化会导致文化危机。是一个严肃的人文方向的主题。我觉得里面有的地方 AI 翻译起来读的不太顺,所以换了几个 AI 模型对比其中一段话的翻译。欢迎大家评论留言谁翻译的最好。

原文:

Josef Piper, writing at the same time as Eliot, but in a defeated and fragmented Germany, declares leisure the basis of culture. By “leisure,” Pieper does not mean idleness, but the more ancient type of leisure — leisure as the Greek σχολή (scholē), or school.

Pieper’s leisure is a contemplative one—it is, in essence, a style of unconstrained research. Such leisure is not merely, or singularly, the pursuit of knowledge “for its own sake,” nor is it simply “reading for pleasure.” The leisure that forms the basis of culture is a directed and intentional curiosity — it is the practice of formulating questions and seeking answers with a disposition towards wonder, not rigid certainty. Where free time is not used for research — for developing questions, and investigating the answers with an explorer’s spirit — cultural coherence crumbles. For Pieper, without leisure as letters, or “research as leisure,” there is no pattern from which higher civilisation is found.

模型对比

为了避免模型名字影响质量判断,下面的模型我会用代号表示。具体的模型我会放在评论区。

我个人的使用经验:Claude 4.5 的翻译太过于直译,翻译效果很差,不在本次的对比里。Qwen Plus、GLM 4.5、DeepL Pro 模型我认为综合能力都比较一般,也不参与本次对比。

有一些推理模型因为思考时间比较久,用作翻译在体验上比较差,因此沉浸式翻译的会员模型没有提供。比如 DeepSeek R1 和 Qwen Max 就是因为响应速度的问题没有加入。但是因为好奇,下面的模型对比中我通过自定义 API 的方式把 R1 的翻译结果放进来了。

参与对比的 7 个模型是:GPT5、GPT5 mini、Gemini2.5 Pro、Gemini2.5 Flash、DeepSeek V3、DeepSeek R1、Kimi K2。

A1

皮珀所说的闲暇是一种沉思性的闲暇——其本质上是一种不受约束的研究方式。这种闲暇不仅仅或不单纯是“为了知识本身”而追求知识,也不只是“为了愉悦而阅读”。构成文化基础的闲暇是一种有导向、有目的的好奇心——它是一种提出问题、寻求答案的实践,其心态是倾向于好奇与惊叹,而非僵化的确定性。如果空闲时间不被用于研究——不被用于带着探索者的精神提出问题、探寻答案——那么文化的凝聚力就会瓦解。对于皮珀而言,如果没有以书信为形式的闲暇,或“以研究为形式的闲暇”,那么更高文明赖以建立的模式便不复存在。

A2

皮珀的休闲是一种沉思式的休闲——它本质上是一种不受约束的研究方式。这种休闲不仅仅是,或单一地,为了“知识本身”而追求知识,也不是简单地“为了乐趣而阅读”。构成文化基础的休闲是一种有方向、有目的的好奇心——它是一种提出问题并以惊奇而非僵硬确定性的态度寻求答案的实践。如果空闲时间不用于研究——不用于提出问题,并以探索者的精神调查答案——文化连贯性就会崩溃。对于皮珀来说,如果没有作为学问的休闲,或者“作为休闲的研究”,就没有发现高级文明的模式。

B

皮珀的闲暇是沉思式的——本质上是一种不受拘束的研究方式。这种闲暇并非单纯或唯一地“为知识而知识”,也不仅仅是“为乐趣而阅读”。构成文化基础的闲暇,是一种有方向、有意识的求知欲——它以好奇而非僵化的确定感为姿态,提出问题并寻找答案。当自由时间未被用于研究——未被用于提出问题、并以探索者的精神去探究答案——文化的一致性就会崩塌。对皮珀而言,若无闲暇即“学问”,或曰“研究即闲暇”,便无从找到更高文明的范式。

C1

皮珀所说的休闲是一种沉思的休闲——本质上是一种不受约束的研究方式。这种休闲不仅仅是单纯地为了“知识本身”而追求知识,也不仅仅是“为了娱乐而阅读”。构成文化基础的休闲是一种有方向、有意图的好奇心——它是一种提出问题并寻求答案的实践,怀有惊奇之心,而非僵化的确定性。当空闲时间不用于研究——不用于提出问题并以探索者的精神调查答案——文化的连贯性就会崩塌。对皮珀而言,没有作为书信的休闲,或“作为休闲的研究”,就没有能够孕育高级文明的模式。

C2

皮佩所指的闲暇是一种沉思式的闲暇——本质上是一种不受约束的研究风格。这种闲暇并不仅仅,或仅仅是为“知识本身”而追求知识,也不仅仅是“为愉悦而阅读”。构成文化基础的闲暇是一种有方向、有意图的好奇心——它是提出问题并以惊奇而非僵化确定性的态度寻求答案的实践。若空闲时间不用于研究——即不用于提出问题并以探险者的精神调查答案——文化的连贯性便会瓦解。对皮佩而言,若没有以字母为载体的闲暇,或“作为闲暇的研究”,便无从找到更高文明形成的模式。

D1

皮珀的休闲是一种沉思式的休闲——本质上,它是一种无拘无束的研究风格。这种休闲不仅限于或单纯是“为知识本身”而追求知识,也不仅仅是“为乐趣而阅读”。构成文化基础的休闲是一种有方向、有意识的求知欲——它是以惊奇而非僵化确定性的态度,去提出问题并寻求答案的实践。倘若空闲时间不被用于研究——不被用于以探索者精神去发展问题并调查答案——文化的凝聚力便会瓦解。对皮珀而言,若没有作为书信的休闲,或“研究即休闲”,便不存在更高文明得以显现的模式。

D2

皮珀所言的闲暇本质上是种沉思状态——它是一种无拘无束的研究方式。这种闲暇不仅(或不仅仅)是"为知识而知识"的追求,也不单纯是"为愉悦而阅读"。构成文化根基的闲暇,是一种有方向、有意识的求知欲——它是以惊奇而非僵化确认为导向,不断提出问题并寻求答案的实践。当自由时光不被用于研究——不以探索者精神培养问题意识、追索答案——文化凝聚力便会瓦解。在皮珀看来,若缺乏作为文字的闲暇,或者说"以研究为闲暇",高等文明就失去了赖以成型的图式。

个人主观看法

三个二线模型:A2、C2、D2

主要对比这句话的翻译:

For Pieper, without leisure as letters, or “research as leisure,” there is no pattern from which higher civilisation is found.

A2:对于皮珀来说,如果没有作为学问的休闲,或者“作为休闲的研究”,就没有发现高级文明的模式。

C2:对皮佩而言,若没有以字母为载体的闲暇,或“作为闲暇的研究”,便无从找到更高文明形成的模式。

D2:在皮珀看来,若缺乏作为文字的闲暇,或者说"以研究为闲暇",高等文明就失去了赖以成型的图式。

这里的“letters”字面意思是文字、字母,但是联系上下文这里指代的是文字作品。直白一些的表达是“以书信为形式的闲暇”,当然考虑到语义的连贯,翻译成“书信”、或者“学问”都说得通。

可以看到 C2 翻译成了“若没有以字母为载体的闲暇”,D2 翻译成了“缺乏作为文字的闲暇”两者都翻译的很生硬。

再看“Pieper”这个名字,除了 C2 所有模型都翻译成了“皮珀”,C2 翻译成了“皮佩”。

再看“pattern”这个词,这里指的是一种模式、范式。但是 D2 理解成了 Schema,翻译成了“图式”。这里属于阅读理解错误,而且“图式”这个词也有点冷门,这么翻译对于阅读的流畅性也有一些扣分。

另外其他模型都把“free time”翻译成了“空闲时间”,只有 D2 风格强烈的翻译成了“自由时光”。“自由时光”的感情色彩有一点强烈了,这里应该是个非常中性的描述。所以我认为 D2 文风过于强烈,在某些场景下不见得加分。

综合下来三个二线模型 A2 翻译结果最接近原文。

二线模型与一线模型的区别

那么同一个公司的普通版和高级版效果有区别吗。

以这句的翻译作为对照:

The leisure that forms the basis of culture is a directed and intentional curiosity — it is the practice of formulating questions and seeking answers with a disposition towards wonder, not rigid certainty.

这个句子是长句,有几个从句。可以看出模型翻译的是否流畅。

A2:构成文化基础的休闲是一种有方向、有目的的好奇心——它是一种提出问题并以惊奇而非僵硬确定性的态度寻求答案的实践。

C2:构成文化基础的闲暇是一种有方向、有意图的好奇心——它是提出问题并以惊奇而非僵化确定性的态度寻求答案的实践。

虽然翻译是正确的,但是“它是一种提出问题并以惊奇而非僵硬确定性的态度寻求答案的实践”这么长的句子读起来还是颇为费力的。

对比一下他们的一线模型的翻译:

A1:构成文化基础的闲暇是一种有导向、有目的的好奇心——它是一种提出问题、寻求答案的实践,其心态是倾向于好奇与惊叹,而非僵化的确定性。

C1:构成文化基础的休闲是一种有方向、有意图的好奇心——它是一种提出问题并寻求答案的实践,怀有惊奇之心,而非僵化的确定性。

可以看到两个一线模型都重新组织了这句话,行文更加本地化和流畅。

单独把两个句子放在一起对比差距是很明显的:

它是一种提出问题并以惊奇而非僵硬确定性的态度寻求答案的实践。

它是一种提出问题、寻求答案的实践,其心态是倾向于好奇与惊叹,而非僵化的确定性。

另外我觉得 A1 的“闲暇是一种有导向、有目的的好奇心”比 C1 的“休闲是一种有方向、有意图的好奇心”要好一些。“意图”在中文里还是用在贬义的场景多一些,“有目的的好奇心”会更加自然一些。

通过这个句子可以看出高级模型在对内容的理解和输出组织上还是比入门版模型效果要好一些。

价格相同的 B 和 D1

这里单独提一下 B 和 D1。如果仔细观察发现这两个模型的中文文采明显好一些。

B:皮珀的闲暇是沉思式的——本质上是一种不受拘束的研究方式。这种闲暇并非单纯或唯一地“为知识而知识”,也不仅仅是“为乐趣而阅读”。构成文化基础的闲暇,是一种有方向、有意识的求知欲——它以好奇而非僵化的确定感为姿态,提出问题并寻找答案。当自由时间未被用于研究——未被用于提出问题、并以探索者的精神去探究答案——文化的一致性就会崩塌。对皮珀而言,若无闲暇即“学问”,或曰“研究即闲暇”,便无从找到更高文明的范式。

D1:皮珀的休闲是一种沉思式的休闲——本质上,它是一种无拘无束的研究风格。这种休闲不仅限于或单纯是“为知识本身”而追求知识,也不仅仅是“为乐趣而阅读”。构成文化基础的休闲是一种有方向、有意识的求知欲——它是以惊奇而非僵化确定性的态度,去提出问题并寻求答案的实践。倘若空闲时间不被用于研究——不被用于以探索者精神去发展问题并调查答案——文化的凝聚力便会瓦解。对皮珀而言,若没有作为书信的休闲,或“研究即休闲”,便不存在更高文明得以显现的模式。

这两个模型价格是一样的,都是国产模型。我对 B 的翻译结果表示惊喜,因为他的上一代真的很普通。能感觉到 B 模型准确理解了文章内容,但是在文字输出的组织上比 D1 会差一些。我的感觉是 B 的智力比 D1 高一点点,但是对文字的输出选择上能力一般。最后的综合完成度上 D1 会好一些,不过也算是有来有回。两个模型都未来可期。

最终的对比: A1 VS C1

对比一下两个顶级模型的翻译结果:

A1:皮珀所说的闲暇是一种沉思性的闲暇——其本质上是一种不受约束的研究方式。这种闲暇不仅仅或不单纯是“为了知识本身”而追求知识,也不只是“为了愉悦而阅读”。构成文化基础的闲暇是一种有导向、有目的的好奇心——它是一种提出问题、寻求答案的实践,其心态是倾向于好奇与惊叹,而非僵化的确定性。如果空闲时间不被用于研究——不被用于带着探索者的精神提出问题、探寻答案——那么文化的凝聚力就会瓦解。对于皮珀而言,如果没有以书信为形式的闲暇,或“以研究为形式的闲暇”,那么更高文明赖以建立的模式便不复存在。

C1:皮珀所说的休闲是一种沉思的休闲——本质上是一种不受约束的研究方式。这种休闲不仅仅是单纯地为了“知识本身”而追求知识,也不仅仅是“为了娱乐而阅读”。构成文化基础的休闲是一种有方向、有意图的好奇心——它是一种提出问题并寻求答案的实践,怀有惊奇之心,而非僵化的确定性。当空闲时间不用于研究——不用于提出问题并以探索者的精神调查答案——文化的连贯性就会崩塌。对皮珀而言,没有作为书信的休闲,或“作为休闲的研究”,就没有能够孕育高级文明的模式。

我个人更喜欢 A1 的翻译结果。主要有两点:

  1. A1 的“闲暇是一种有导向、有目的的好奇心”比 C1 的“休闲是一种有方向、有意图的好奇心”要好一些。
  2. A1 的“文化的凝聚力就会瓦解”比 C1 的“文化的连贯性就会崩塌”更加合理一点。

对翻译质量的一些补充

这里补充一下基础的翻译功能介绍。假设一篇文章有 20 个自然段,可以简单的理解是是把这 20 个自然段同时进行翻译,而不是一篇文章一次性输入输出。这么做的原因主要还是因为速度。因此从翻译体验来说,一个模型的响应速度和并发都要考虑。

每个自然段都是独立翻译,就会有前后翻译不一致的问题。有些翻译会因为语境不同有不同的翻译结果,有些段落缺少了这个语境也会因此导致不一致。因此这里为了优化质量、提高一致性翻译中可以提前让模型把全文读一遍,总结一些文章内容。在翻译每个段落的时候都带上统一的全文总结。这样读了全文后再翻译其中的一个段落效果就会更好一些。当然代价就是翻译同样的文章等于要多读一遍,消耗的 token 会是1 - 2 倍。这个功能在沉浸式翻译里叫“AI 智能上下文”。

Image

因此在阅读长文里,智力更高的 AI 的翻译质量提升会更明显一些。如果只是一条评论,模型的区别就没那么大。

价格

这里再提一嘴价格,GPT5 的百万 token 输出的价格是 10 美元,DeepSeekR1 的价格是 16 元,入门版 GPT5 mini 的价格是 2 美元。可以简单的理解为国际二线模型价格等于国内 1.5 线模型的价格(R1 和 Kimi K2),一线模型的价格是二线模型的 5 倍。

在长文翻译质量上我觉得大概是 70 分、80 分、90 分的差距。在短内容上可能一档只有 5 分的差距。从价格上看可以粗暴的理解为提升20% 的翻译质量要多付 5 倍的钱。可以看出如果阅读常规的社媒信息、技术文档,这个提升的性价比是很低的。不过如果读的是生产力内容,比如学术论文、行业研究报告、专栏文章,一个月在翻译内容上花 100 - 200 元还是可以接受的。

这里再举一个例子,可以理解为顶级模型翻译一本电子书的成本要 50 元,如果你的这个电子书的获取成本低于 50 元,你就会觉得贵。如果这个行业报告你是花了 500 元从某个机构买的,你花 50 元得到一个更好的翻译质量就会觉得合理。