首页 > 资讯 > RLHF奠基人保罗·克里斯蒂亚诺加入OpenAI理事会:最强批评者入局,评测独立性存结构性张力

RLHF奠基人保罗·克里斯蒂亚诺加入OpenAI理事会:最强批评者入局,评测独立性存结构性张力

赢政天下 2026-09-13 14:26 3 阅读 查看原文

2026年9月9日,OpenAI宣布任命保罗·克里斯蒂亚诺(Paul Christiano)为基金会理事会成员,并加入由卡内基梅隆大学教授齐科·科尔特(Zico Kolter)主持的安全与安保委员会。该委员会拥有对所有OpenAI模型发布的最终裁量权。克里斯蒂亚诺同时以非投票观察员身份出席OpenAI Group PBC董事会。

克里斯蒂亚诺曾公开写道,他“认为AI能力快速加速在极近期内导致灾难性且不可逆的控制失败,存在有实质意义的概率”,并直接点名称“包括OpenAI在内的AI行业目前并未走在将此风险降至可接受水平的轨道上”。他是AI安全领域最知名的外部批评者之一,如今入局的恰恰是他曾公开批判的机构的治理核心。

从RLHF到对齐研究:他是谁

克里斯蒂亚诺是强化学习人类反馈(RLHF)技术的核心奠基人。RLHF是当前几乎所有主流大型语言模型——包括GPT系列、Claude系列——让模型行为符合人类偏好的核心训练方法:先让人类标注者对模型输出做优劣排序,再据此训练一个“奖励模型”,最后用这个奖励信号通过强化学习进一步微调语言模型。没有RLHF,今天的对话式AI大概率仍是不可控的文本续写机器。

克里斯蒂亚诺在OpenAI主导对齐研究团队直至2021年,随后离开创立了非营利机构对齐研究中心(ARC),并孵化出专注于前沿AI模型第三方评测的METR(模型评测与威胁研究)。2024年,他出任美国NIST人工智能安全研究所(现已更名为AI标准与创新中心)AI安全负责人,成为美国政府前沿AI安全政策的核心技术顾问。

安全委员会的实际权力与回避条款的边界

克里斯蒂亚诺加入的安全与安保委员会,在OpenAI的治理结构中拥有对模型发布的最终裁量权,案例中明确提及的包括对“Astra”模型的最终判断。这意味着安全委员会的决策在实质上高于产品团队的发布意愿。

随任命公布的强制回避条款要求克里斯蒂亚诺须回避所有OpenAI相关事务,以及所有模型评测工作。一个拥有最终发布否决权的委员会成员,被制度性地排除在“模型评测”这一决策前置环节之外。

安全委员会的职责可以被区分为“制定安全标准与治理框架”和“判断具体模型是否合规”两个层次,前者不依赖模型评测数据,后者才直接依赖。但这个区分在实践中能否干净落地,目前没有公开的操作细则。

结构性矛盾:外部评测者的创始人坐进了被评测者的治理层

METR被广泛视为AI行业独立第三方评测体系的核心机构,其存在意义正是以机构独立性为前提。当METR向监管机构或公众提交OpenAI模型的安全评测报告时,外界可以提出一个合理问题:评测者的创始人坐在被评测者的理事会里,这份报告的独立性如何保证?

据报道,克里斯蒂亚诺在NIST的职责包括对前沿模型进行评测,但强制回避条款要求他不得参与OpenAI模型的评测。这在实操上意味着他可以评测Anthropic、Google DeepMind等竞争对手的模型,却对OpenAI的模型视而不见。这种非对称性不仅影响他在政府侧角色的完整性,也对竞争格局产生潜在影响。

OpenAI为何在此时引入他

2025年至2026年间,AI能力的快速跃升使安全承诺的可信度压力持续上升。基金会理事会主席布雷特·泰勒(Bret Taylor)在官方声明中评价克里斯蒂亚诺“用严谨的研究定义了AI对齐领域,始终专注于日益强大的系统所提出的最难问题”。OpenAI需要一位在安全社区拥有无可置疑公信力的人,为其治理结构背书。

克里斯蒂亚诺在声明中写道:“过去一年AI能力的进步非常迅速,对齐仍是一个困难的技术问题,这使得安全与安保委员会的责任比以往任何时候都更加重要,也更加艰巨。”他接受这一职位,字面意思是他认为从内部施压比持续外部批评更有可能产生实际效果。

但这也意味着,他在接受任命后,将在公开场合对OpenAI的批评有所收敛。一个此前在公开文章中直接写明“OpenAI没有走在正确轨道上”的人,进入理事会后若继续公开指名批评,将面临规范冲突;若保持沉默,外界则会质疑他是否已被“驯化”。这是治理结构对批评者施加的系统性约束。

对AI治理生态的信号意义

这一任命折射出AI行业在监管压力下的一个普遍选择模式:把最有力的批评者纳入体制内,通过制度安排将批评转化为内部治理压力,同时以“我们已经引入了最严苛的声音”作为对外部质疑的回应。

外部批评者的确可以通过内部渠道产生实质影响,前提是治理结构给予了真实的决策权力,而不仅仅是象征性的席位。安全与安保委员会被描述为对模型发布拥有“最终裁量权”,这在形式上赋予了克里斯蒂亚诺实质性的否决空间。

问题在于,这种权力能否在强制回避条款的约束下得到有效行使,目前没有足够的公开信息可以判断。他无法参与模型评测的规定,究竟是一道无关痛痒的程序防火墙,还是一把让他在委员会最核心议题上缺席的制度锁——这取决于安全委员会在实际运作中如何区分“评测”与“决策”这两个环节。

克里斯蒂亚诺此前同时担任美国政府AI安全负责人与METR创始人,本已是一种双重角色。加入OpenAI理事会后,他同时持有政府、独立评测机构和被评测对象三个维度的关联,这种身份叠加在全球AI治理实践中几乎是前所未有的案例。它的危险在于:三重角色中任何一方都可以援引“利益冲突”来质疑他在其他两方的判断,从而系统性地削弱他在每个角色中的有效性。