首页 > 资讯 > 3大模型翻译对决:第40周质量评测,deepseek-v4-pro 以 8.7 分领跑

3大模型翻译对决:第40周质量评测,deepseek-v4-pro 以 8.7 分领跑

赢政天下 2026-09-28 07:13 8 阅读 查看原文

本周 417 篇翻译任务,由 3 个模型完成。抽样 3 篇进行多模型盲评对比,综合最佳:deepseek-v4-pro(均分 8.7/10)。

本周翻译统计

模型 语言 翻译量 平均耗时 平均质量评分
deepseek-v4-flash en 63 23.8s 未评
claude-sonnet-4.6 ja 208 48.1s 未评
passthrough en 144 0s 未评
native-english en 1 - 未评
deepseek-v4-flash zh 1 4.1s 未评

抽样对比评测

评测 1:我克隆了一个会说话的自己:AI数字分身的喜与忧

模型 准确性 流畅性 术语 可读性 总分
claude-sonnet-4.6 8 7 9 8 8
deepseek-v4-pro 9 9 8 9 9
gpt-o3 8 8 9 8 8

claude-sonnet-4.6

✓ 术语处理准确,如「レッドフラッグ」直接保留专业表达并配中文解释「投资尽职调查中的警示信号」。

✗ 部分句子过长且带翻译腔,例如「見慣れた顔をして、いつもの自分の口調で話しているのに、それは自分ではない」略显生硬。

deepseek-v4-pro

✓ 语言自然流畅,如「背筋が凍る思いだった」准确传达「背脊发凉」的惊悚感,且衔接顺畅。

✗ 个别术语略显直译,如「レッドフラッグ・シグナル」可再精简为更常见表达。

gpt-o3

✓ 结构清晰,引用部分处理得体,如「ぞっとしました」自然传达「毛骨悚然」。

✗ 部分表述稍显平淡,如「よどみなく語る様子」缺少原文的紧张情绪层次。

结论:版本B整体最优,流畅性与准确性平衡最好,建议优先选用;A和C在完整性上均有明显缺陷。

评测 2:科技巨头将3000亿美元AI债务移出账本:表外担保结构如何掩盖系统性风险

模型 准确性 流畅性 术语 可读性 总分
claude-sonnet-4.6 7 6 8 5 6
deepseek-v4-pro 9 8 9 8 8
gpt-o3 8 9 8 9 9

claude-sonnet-4.6

✓ 术语如「残余価値保証+特別目的事業体(SPV)」使用较为准确,符合金融语境。

✗ 文本明显截断,「这个「脚注的盲」处未完成,严重影响可读性。

deepseek-v4-pro

✓ 术语一致性高,「残存価値保証」「特別目的会社(SPV)」全程统一,且「教科書レベルの構造モデル」表述自然贴切。

✗ 部分长句稍显累赘,如第二段中Blue Owl结构描述略多重复。

gpt-o3

✓ 流畅性最佳,「帳簿の外にある実質的エクスポージャー」小标题翻译简洁自然,段落衔接清晰。

✗ 部分术语略有不一致,如「残存価値保証」与「潜在損失引当金」混用,未完全统一。

结论:版本C整体最优,流畅性和可读性领先;版本B术语最严谨;版本A因截断问题明显落后。

评测 3:五角大楼斥资3000万美元打造AI测谎仪

模型 准确性 流畅性 术语 可读性 总分
claude-sonnet-4.6 8 9 9 8 8
deepseek-v4-pro 9 8 9 9 9
gpt-o3 9 8 8 9 8

claude-sonnet-4.6

✓ 流畅性较好,「米国防総省のAI嘘発見器計画」标题自然对应原文结构,逻辑衔接顺畅。

✗ 结尾出现明显截断,「——これは」未完成,影响可读性。

deepseek-v4-pro

✓ 准确性高,「国防総省が3000万ドルを投じてAIポリグラフを開発」标题直接对应原文含义,无添加。

✗ 部分表述略显生硬,「一つのレッドライン」虽保留原意但略带翻译腔。

gpt-o3

✓ 可读性佳,「ペンタゴン、3000万ドルを投じてAI嘘発見器を開発」标题简洁有力,段落衔接清晰。

✗ 术语一致性稍弱,「嘘発見器」与「polygraph」混用,未完全统一。

结论:三个版本整体质量接近,B版在准确性和可读性上略胜一筹,A版因截断问题稍逊,C版术语处理可进一步优化。