5大模型翻译对决:第37周质量评测,claude-sonnet-4.6 以 9 分领跑

本周共翻译 368 篇文章,覆盖 5 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。

本周 368 篇翻译任务,由 5 个模型完成。抽样 3 篇进行多模型盲评对比,综合最佳:claude-sonnet-4.6(均分 9/10)。

本周翻译统计

模型语言翻译量平均耗时平均质量评分
deepseek-v4-flashen7860.8s未评
claude-sonnet-4.6ja18349s未评
passthroughen1020s未评
native-englishen2-未评
deepseek-v4-flashzh248.6s未评
deepseek-v4-flash:backtranslateen125.9s未评

抽样对比评测

评测 1:AfterQuery创YC最快独角兽纪录,估值32亿美元

模型准确性流畅性术语可读性总分
passthrough98978
deepseek-v4-pro68787
gpt-o369797

passthrough

✓ 最忠实原文,「This just five months after announcing its $30 million Series A at a $300 million valuation in April」直接对应原文时间与估值对比,无添加内容。

✗ 末尾段落明显截断,「However, rather than ensuring th」导致可读性受损。

deepseek-v4-pro

✓ 标题处理清晰,「AfterQuery Sets YC Record for Fastest Unicorn, Valued at $3.2 Billion」直接点明核心信息。

✗ 大量添加原文未有的内容,如「According to TechCrunch」「oversubscribed within days of launching」,属于过度意译。

gpt-o3

✓ 段落衔接流畅,「Why Is This Company So Popular With Investors?」小标题使逻辑更清晰。

✗ 同样添加原文未提及的「oversubscribed within days of launch」及投资者偏好描述,偏离原文。

结论:版本A准确性最高但因截断影响完整性,B和C流畅性更好但均存在较多添加内容,整体A更接近原文要求。

评测 2:Grok 4代码执行暴跌21.8分 主榜从89.15降至84.99

模型准确性流畅性术语可读性总分
claude-sonnet-4.698999
deepseek-v4-pro87787
gpt-o398898

claude-sonnet-4.6

✓ 术语使用「素材制約」与原文「素材约束」高度一致,且段落结构清晰,使用「」引用如「コード実行の問題で1問失敗するだけで」准确对应原文含义。

✗ 译文末尾明显截断,「Grok 4を全体として過大評価または過」未完成,影响整体完整性。

deepseek-v4-pro

✓ 结构分明,标题与正文衔接自然,如「メインランキングはコード実行と材料制約の加重のみで構成される」逻辑清晰。

✗ 术语「材料制約」与原文「素材约束」不一致,多次出现可能降低专业性;部分句子略显生硬。

gpt-o3

✓ 因果分析部分衔接流畅,如「問題のランダム抽出による変動か」表述自然且忠实原文逻辑。

✗ 同样存在截断问题,末尾「問題」后内容不完整;术语「材料制約」与A版相比略逊。

结论:版本A在术语准确性和结构可读性上表现最佳,但因截断问题扣分;B和C整体接近,C略优于B,建议优先A(修复截断后)或C。

评测 3:WDCD Run #311: Grok 4 Leads with 93.2 Points as GLM-4.6 Sets New Decay Resistance Record

模型准确性流畅性术语可读性总分
native-english99989
deepseek-v4-pro21111
gpt-o388978

native-english

✓ 术语使用准确且专业,例如「Winzheng Dynamic Contextual Decay (WDCD)」完整保留了基准名称并给出全称解释。

✗ 文本在结尾处明显截断,「At the opposite end of」后内容缺失,导致可读性受影响。

deepseek-v4-pro

✓ 无明显优点,直接拒绝翻译任务。

✗ 完全未提供翻译内容,仅输出错误提示「未能找到中文文本」,属于严重漏译。

gpt-o3

✓ 术语一致性较好,例如「multi-turn commitment resistance」与原文含义对应准确。

✗ 同样存在截断问题,最后一段「original constrain」明显未完成,影响整体流畅性。

结论:版本A整体质量最高,B版本完全失败,C版本与A接近但同样截断。