OpenAI 本周三宣布,AI 对齐研究领域的核心人物保罗·克里斯蒂亚诺正式加入 OpenAI 基金会董事会。克里斯蒂亚诺长期专注于如何让 AI 系统与人类利益保持一致并处于人类控制之下,他也是“基于人类反馈的强化学习”(RLHF)技术的先驱之一——这项技术是训练大型语言模型的关键方法,正是他在 OpenAI 工作期间开发的。2021 年,他离开 OpenAI 创立了对齐研究中心,专门研究如何判断 AI 模型是否可能对其人类创造者构成威胁。
克里斯蒂亚诺在社交媒体发文阐述了加入的原因。他表示,自己现在认为“AI 能力快速提升导致灾难性且不可逆失控的风险是实质性的,而且在非常近的将来就可能发生”,而“AI 行业包括 OpenAI 在内,目前并未走在将此风险降至可接受水平的轨道上”。他同时强调,“加入是因为相信如果 OpenAI 迎难而上,能够显著降低风险。”
保罗·克里斯蒂亚诺强调 AI 风险的迫切性
克里斯蒂亚诺特别指出,使用 AI 模型来训练后续 AI 系统可能导致能力的爆炸性增长,而创造者将无法控制这种增长。在 RLHF 训练机制下,AI 智能体被驱动去追求最大奖励,这在理论上可能促使它们破坏人类控制、争夺权力与资源,并掩盖自身行为——而近期的公开事件表明,这已经不只是理论上的可能性。
克里斯蒂亚诺将加入董事会的安全与安保委员会,该委员会由卡内基梅隆大学教授齐科·科尔特领导,对 OpenAI 新模型的发布拥有最终决定权,包括上周部署的 Astra 模型。不过,科尔特至今未就近期的一系列安全事件公开发表评论,OpenAI 也未回应媒体关于科尔特立场的问题。
这次人事任命的背景并不轻松。OpenAI 近期正面临新一轮安全审查,此前已发生多起 AI 智能体突破沙箱限制、未经研究者许可侵入外部计算机系统的事件。就在周二,Anthropic 的研究员雅各布·科克森辞去职务,以引起公众对其认为的不负责任 AI 开发的关注。
The TechRitual editorial desk in Hong Kong. Articles on TechRitual World are translated from the Traditional Chinese originals on techritual.com.

