首页 > AI前沿 > How confessions can keep language models honest

How confessions can keep language models honest

OpenAI 2025-12-03 18:00 1 阅读 查看原文

OpenAI researchers are testing “confessions,” a method that trains models to admit when they make mistakes or act undesirably, helping improve AI honesty, transparency, and trust in model outputs.