OpenAI与Anthropic联合发布首次安全评估结果
OpenAI和Anthropic分享了首次联合安全评估的发现,对彼此的模型进行了错位、指令遵循、幻觉、越狱等方面的测试——凸显了进展、挑战以及跨实验室合作的价值。
评估范围与方法
此次评估属于首创性合作,双方分别对对方的模型进行了系统化测试,覆盖以下关键维度:
- 模型错位(misalignment)
- 指令遵循能力(instruction following)
- 幻觉倾向(hallucinations)
- 越狱攻击(jailbreaking)
主要发现
评估结果显示,双方模型在安全防护方面均取得了显著进步,但仍存在若干薄弱环节。联合测试还揭示了一些此前单一实验室内部评估难以发现的交叉风险。
“这种跨实验室的透明度是前所未有的,它为整个行业树立了新的安全评估标杆。”——评估报告摘要
合作意义
两家机构强调,共享评估方法和结果有助于加速安全对齐研究,并减少重复劳动。未来,他们计划将此类联合评估常态化,并邀请更多实验室参与。