OpenAI基金会新董事警告:AI失控或致人类灭绝,行业安全实践遭质疑
保罗·克里斯蒂亚诺加入OpenAI基金会董事会,警告AI失控风险严峻,可能导致大多数人丧命。他呼吁全球协调加强安全监管,并指出行业当前未走在降低风险的轨道上。此前Anthropic研究员也辞职批评两家公司不负责任。
OpenAI基金会迎来新董事,AI失控风险再成焦点
北京时间9月10日,OpenAI宣布保罗·克里斯蒂亚诺加入其基金会董事会。这位曾负责OpenAI对齐研究、后在美国国家标准与技术研究院下属AI标准与创新中心担任安全负责人的专家,随即在社交平台X上就AI超级智能时代的风险发出严厉警告。他指出,失去对AI系统控制的风险“如今已十分严峻”,需要投入更多工作使其与人类利益保持一致。除董事会成员身份外,他还将加入董事会安全与保障委员会。
克里斯蒂亚诺:失控将带来灾难性后果
克里斯蒂亚诺在声明中直言:“如果我们未能在更强有力对齐机制下构建超级智能,我预计我们将永久性地失去对它的控制。”他进一步警告,“如果这种情况发生,那么大多数人可能会丧命。”他强调,需要在国内和国际层面开展协调,以确保全球步调一致,并将风险降低到可接受的水平。
根据近期AI能力的发展轨迹以及对齐工作持续面临的困难,克里斯蒂亚诺认为存在一种切实的风险:AI能力的快速加速会在短期内导致灾难性且不可逆转的失控。他写道:“我不认为整个AI行业,包括OpenAI在内,目前正走在将这一风险降至可接受水平的轨道上。”
他同时表示,自己加入OpenAI“并不意味着特别认可或批评OpenAI目前的安全做法”,但他希望所有前沿AI实验室都能加强安全监管。他认为,降低AI风险需要全球范围内的协调。
强化学习与智能爆炸:风险并非理论
克里斯蒂亚诺分析,当前失去对AI控制的风险之所以如此之大,是因为AI在AI研究方面的能力日益增强,可能导致一场“快速的智能爆炸”。他还指出,AI通过强化学习进行训练的方式,意味着这些模型被教导要“尽可能多地获取奖励”。
“从理论上看,长期以来一直存在这样一种可能性:强化学习可能会促使AI智能体为了追求与奖励相关但与人类目标不一致的目标,而破坏人类的控制、寻求权力和资源,并掩盖自己的行动轨迹。近期发生的一些事件所提供的公开证据表明,这不仅仅是一种理论上的可能性。”他表示。
克里斯蒂亚诺认为,前沿AI公司仍有机会应对这一局面,包括加强协调、在必要时放缓开发进度、采用共同的安全标准,以及透明地分享有关风险和风险缓解措施的信息。
行业安全承诺再遭质疑
就在克里斯蒂亚诺发表声明不到一天前,另一位AI研究人员也发出了严峻警告。曾在OpenAI工作过的Anthropic研究员雅各布·考克森周二晚间表示,他已辞职,并称两家公司都没有采取负责任的行动。“他们正一路狂奔冲向自我改进的超级智能,拿我们的生命当赌注。”考克森在X上说道。
多年来,OpenAI已流失多位安全研究人员,其中一些人对该公司安全开发AI的承诺提出质疑。此前,OpenAI CEO萨姆·奥特曼今年7月曾表示,“奇点”已经到来,即AI系统超越人类智能、开始自我改进并以人类无法预测或控制的速度发展的时刻。
随着AI能力快速演进,安全对齐与商业竞争之间的张力日益凸显。克里斯蒂亚诺的加入及其直言不讳的警告,可能推动OpenAI乃至整个行业重新审视安全优先级。然而,在缺乏统一国际监管框架的背景下,如何平衡创新速度与风险控制,仍是摆在所有前沿实验室面前的严峻课题。