本周 368 篇翻译任务,由 5 个模型完成。抽样 3 篇进行多模型盲评对比,综合最佳:claude-sonnet-4.6(均分 9/10)。
本周翻译统计
| 模型 | 语言 | 翻译量 | 平均耗时 | 平均质量评分 |
|---|---|---|---|---|
| deepseek-v4-flash | en | 78 | 60.8s | 未评 |
| claude-sonnet-4.6 | ja | 183 | 49s | 未评 |
| passthrough | en | 102 | 0s | 未评 |
| native-english | en | 2 | - | 未评 |
| deepseek-v4-flash | zh | 2 | 48.6s | 未评 |
| deepseek-v4-flash:backtranslate | en | 1 | 25.9s | 未评 |
抽样对比评测
评测 1:AfterQuery创YC最快独角兽纪录,估值32亿美元
| 模型 | 准确性 | 流畅性 | 术语 | 可读性 | 总分 |
|---|---|---|---|---|---|
| passthrough | 9 | 8 | 9 | 7 | 8 |
| deepseek-v4-pro | 6 | 8 | 7 | 8 | 7 |
| gpt-o3 | 6 | 9 | 7 | 9 | 7 |
passthrough
✓ 最忠实原文,「This just five months after announcing its $30 million Series A at a $300 million valuation in April」直接对应原文时间与估值对比,无添加内容。
✗ 末尾段落明显截断,「However, rather than ensuring th」导致可读性受损。
deepseek-v4-pro
✓ 标题处理清晰,「AfterQuery Sets YC Record for Fastest Unicorn, Valued at $3.2 Billion」直接点明核心信息。
✗ 大量添加原文未有的内容,如「According to TechCrunch」「oversubscribed within days of launching」,属于过度意译。
gpt-o3
✓ 段落衔接流畅,「Why Is This Company So Popular With Investors?」小标题使逻辑更清晰。
✗ 同样添加原文未提及的「oversubscribed within days of launch」及投资者偏好描述,偏离原文。
结论:版本A准确性最高但因截断影响完整性,B和C流畅性更好但均存在较多添加内容,整体A更接近原文要求。
评测 2:Grok 4代码执行暴跌21.8分 主榜从89.15降至84.99
| 模型 | 准确性 | 流畅性 | 术语 | 可读性 | 总分 |
|---|---|---|---|---|---|
| claude-sonnet-4.6 | 9 | 8 | 9 | 9 | 9 |
| deepseek-v4-pro | 8 | 7 | 7 | 8 | 7 |
| gpt-o3 | 9 | 8 | 8 | 9 | 8 |
claude-sonnet-4.6
✓ 术语使用「素材制約」与原文「素材约束」高度一致,且段落结构清晰,使用「」引用如「コード実行の問題で1問失敗するだけで」准确对应原文含义。
✗ 译文末尾明显截断,「Grok 4を全体として過大評価または過」未完成,影响整体完整性。
deepseek-v4-pro
✓ 结构分明,标题与正文衔接自然,如「メインランキングはコード実行と材料制約の加重のみで構成される」逻辑清晰。
✗ 术语「材料制約」与原文「素材约束」不一致,多次出现可能降低专业性;部分句子略显生硬。
gpt-o3
✓ 因果分析部分衔接流畅,如「問題のランダム抽出による変動か」表述自然且忠实原文逻辑。
✗ 同样存在截断问题,末尾「問題」后内容不完整;术语「材料制約」与A版相比略逊。
结论:版本A在术语准确性和结构可读性上表现最佳,但因截断问题扣分;B和C整体接近,C略优于B,建议优先A(修复截断后)或C。
评测 3:WDCD Run #311: Grok 4 Leads with 93.2 Points as GLM-4.6 Sets New Decay Resistance Record
| 模型 | 准确性 | 流畅性 | 术语 | 可读性 | 总分 |
|---|---|---|---|---|---|
| native-english | 9 | 9 | 9 | 8 | 9 |
| deepseek-v4-pro | 2 | 1 | 1 | 1 | 1 |
| gpt-o3 | 8 | 8 | 9 | 7 | 8 |
native-english
✓ 术语使用准确且专业,例如「Winzheng Dynamic Contextual Decay (WDCD)」完整保留了基准名称并给出全称解释。
✗ 文本在结尾处明显截断,「At the opposite end of」后内容缺失,导致可读性受影响。
deepseek-v4-pro
✓ 无明显优点,直接拒绝翻译任务。
✗ 完全未提供翻译内容,仅输出错误提示「未能找到中文文本」,属于严重漏译。
gpt-o3
✓ 术语一致性较好,例如「multi-turn commitment resistance」与原文含义对应准确。
✗ 同样存在截断问题,最后一段「original constrain」明显未完成,影响整体流畅性。
结论:版本A整体质量最高,B版本完全失败,C版本与A接近但同样截断。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接