4大模型翻译对决:第30周质量评测,claude-sonnet-4.6 以 8.5 分领跑

本周共翻译 368 篇文章,覆盖 4 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(8.5/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。

本周 368 篇翻译任务,由 4 个模型完成。抽样 3 篇进行多模型盲评对比,综合最佳:claude-sonnet-4.6(均分 8.5/10)。

本周翻译统计

模型语言翻译量平均耗时平均质量评分
deepseek-v4-flashen6415s未评
claude-sonnet-4.6ja18336.4s未评
passthroughen1170s未评
native-englishen1-未评
deepseek-v4-flashzh118.4s未评
deepseek-v4-flash:backtranslateen211.9s未评

抽样对比评测

评测 1:热泵在美国为何仍如此火爆?

模型准确性流畅性术语可读性总分
claude-sonnet-4.699999
deepseek-v4-pro87877
gpt-o398988

claude-sonnet-4.6

✓ 逻辑衔接自然,如「热泵是本质上逆向运行的空调」表述清晰且符合技术语境。

✗ 部分段落稍长,信息密度高可能影响快速阅读。

deepseek-v4-pro

✓ 术语如「空气源ヒートポンプ」翻译准确。

✗ 流畅性不足,「突然爆発的に普及した」带有生硬翻译腔。

gpt-o3

✓ 政策部分表述严谨,「インフレ抑制法」术语一致。

✗ 部分句子稍显冗长,如冷暖房效率描述可再精简。

结论:版本A整体最佳,准确性与流畅性兼顾;版本C次之;版本B存在轻微流畅性与意译问题。

评测 2:旧金山要求苹果谷歌下架AI‘脱衣’应用

模型准确性流畅性术语可读性总分
claude-sonnet-4.698988
deepseek-v4-pro87877
gpt-o399899

claude-sonnet-4.6

✓ 术语使用准确且一致,如「フェイススワップ」贯穿全文,忠实对应原文“face-swap”。

✗ 部分长句略显累赘,如第一段末尾“被害者の大多数は何も知らない女性や少女たちである”可更简洁。

deepseek-v4-pro

✓ 标题翻译直接明了,“サンフランシスコ、AppleとGoogleにAI「脱衣」アプリの削除を要求」清晰传达原文主旨。

✗ 流畅性稍差,部分表述如「虚偽のヌード画像」略显生硬,不如其他版本自然。

gpt-o3

✓ 整体可读性最佳,段落衔接流畅,如“顔入れ替え”译法自然且逻辑清晰。

✗ 术语一致性略逊,如“顔入れ替え”与“face-swap apps”混用,未完全统一。

结论:版本C(gpt-o3)整体最佳,流畅性和可读性突出;版本A准确性强;版本B稍弱于其他两者。

评测 3:黄仁勋日本之行:全科技生态交易背后有何玄机?

模型准确性流畅性术语可读性总分
passthrough98988
deepseek-v4-pro37674
gpt-o348785

passthrough

✓ 准确还原原文时间「July 15 and 16」,并忠实描述黄仁勋此行与日本产业界的合作细节,未添加虚构内容。

✗ 文本在结尾处突然截断,「The country doesn’t want to run i」导致信息不完整,影响整体可读性。

deepseek-v4-pro

✓ 段落衔接较为流畅,「SoftBank's AI Network Ambition」小标题使用清晰。

✗ 严重偏离原文,「From June 17 to July 20」与原文July 15-16时间完全不符,且添加大量原文未提及的SoftBank、Sony、Toyota具体交易细节,属于过度添加。

gpt-o3

✓ 语言较为自然,「Jensen Huang’s Japan Trip」标题翻译简洁,「unprecedented opportunities」表达较为地道。

✗ 与deepseek版本类似,虚构「June 17 to July 20」时间以及大量未在原文中出现的SoftBank合作细节,准确性受损。

结论:版本A准确性最高,B和C均存在严重事实错误与内容添加,不推荐使用。