4大模型翻译对决:第35周质量评测,gpt-o3 以 8.3 分领跑

本周共翻译 358 篇文章,覆盖 4 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。

本周 358 篇翻译任务,由 4 个模型完成。抽样 3 篇进行多模型盲评对比,综合最佳:gpt-o3(均分 8.3/10)。

本周翻译统计

模型语言翻译量平均耗时平均质量评分
deepseek-v4-flashen7138.8s未评
claude-sonnet-4.6ja17841.3s未评
passthroughen1030s未评
native-englishen2-未评
deepseek-v4-flashzh223.4s未评
deepseek-v4-flash:backtranslateen216.8s未评

抽样对比评测

评测 1:Claude Opus 4.7以95.08分居首:2026-08-21 Smoke快测数据简报

模型准确性流畅性术语可读性总分
deepseek-v4-flash87988
deepseek-v4-pro98988
gpt-o378887

deepseek-v4-flash

✓ 术语处理较为准确,「0.55 × Code Execution + 0.45 × Material Constraints」公式保留了原文结构。

✗ 开头直接跳入正文,未翻译标题,「On 2026-08-21, the YZ Index Smoke quick test」略显生硬。

deepseek-v4-pro

✓ 标题翻译完整自然,「Claude Opus 4.7 tops with 95.08 points」直接对应原文含义。

✗ 表格中「豆包 Pro」保留中文,其余模型全英文,风格略不统一。

gpt-o3

✓ 部分表述更口语化,「suitable for observing short-term signals」流畅自然。

✗ 「Winzheng YZ Index」属于误译,原文未出现Winzheng这一说法。

结论:版本B整体最均衡,标题完整、术语一致且无明显错误;版本A缺少标题,版本C存在误译。

评测 2:币安推出Agent OS,AI代理可自主交易但需用户把控

模型准确性流畅性术语可读性总分
passthrough65745
deepseek-v4-pro88978
gpt-o399989

passthrough

✓ 准确引入了Binance现有工具如「Binance APIs, Binance Wallet Agentic Hub」,保留了原文技术细节。

✗ 译文严重截断,最后一句「However, as the AI race moves away from chatbots that answer questions to agents capable of taking action, Bin」直接中断,影响完整性。

deepseek-v4-pro

✓ 使用「human-machine collaboration」概念并以「用户负责定义目标和约束」解释,逻辑清晰且贴合原文。

✗ 同样存在截断问题,最后「Risks and responsibilities: Platfo」未完成,影响可读性。

gpt-o3

✓ 在「shape the agent’s behavior by setting trading strategies, risk thresholds, and permission boundaries」处处理自然,术语一致且流畅。

✗ 结尾同样截断为「Risks and Responsibility: The Pla」,与B版本类似影响整体完整性。

结论:版本C(gpt-o3)整体最优,准确性、流畅性和可读性均领先;A版本因HTML残留和严重截断最差;B、C内容相近但C句式更自然。

评测 3:Linkdaze智能日历:AI管家免费管好一个家

模型准确性流畅性术语可读性总分
passthrough58776
deepseek-v4-pro87888
gpt-o399999

passthrough

✓ 流畅性较好,「With back-to-school season approaching」自然融入开场场景

✗ 准确性不足,未体现原文「AI管家免费管好一个家」的核心卖点,内容偏离主题

deepseek-v4-pro

✓ 术语一致性较强,「AI meal planning tool」与「paywall」翻译准确统一

✗ 流畅性略有翻译腔,「In today's landscape, where smart calendar apps are emerging one after another」略显生硬

gpt-o3

✓ 可读性最佳,「From “Personal Schedule” to “Household Hub”」小标题逻辑清晰且自然

✗ 无明显缺陷,但结尾同样被截断

结论:版本C(gpt-o3)整体最优,准确性、流畅性与可读性均领先;版本B次之;版本A偏差较大,不推荐。