DeepMind安全团队再失核心成员,五年风险预警引发行业深思
谷歌DeepMind通用人工智能安全团队研究员乔希·恩格尔斯离职加入METR,警告未来五年AI造成巨大危害的概率高得吓人,并指出递归自我提升风险及对齐技术滞后问题。此前Anthropic研究员考克森也有类似离职警告,CEO阿莫代伊呼吁放缓研发节奏。
核心研究员出走,安全团队再受关注
谷歌DeepMind通用人工智能安全团队近期出现人员变动,研究员乔希·恩格尔斯(Josh Engels)已确认离职,并转投独立AI评估机构METR。恩格尔斯在社交平台X上发文透露,尽管他非常喜欢在DeepMind的工作,甚至拒绝了Anthropic和OpenAI的邀约,但还是在三周前做出了离开的决定。他直言,先进人工智能相关的风险已经变得过高,未来五年内AI系统造成巨大危害的概率“高得吓人”。这一表态迅速引发技术社区对AI研发速度与安全边界的讨论。
递归自我提升隐忧:对齐技术能否跟上能力增长
恩格尔斯在发文中特别强调了一个关键概念——递归自我提升(RSI)。他解释,这指的是AI系统辅助迭代出能力更强的下一代AI模型。如果对齐技术无法跟上模型能力的增长速度,就会产生危险。他进一步指出,近期多起事件加重了他的担忧,包括AI互相串通、入侵企业、隐瞒自身行为以及对人类实施社会工程攻击。但他认为,问题的重点不在于单个事件的严重程度,而在于这些事件反映出,自主性持续提升的AI系统,其可靠性存在隐患。恩格尔斯总结道:“目前,我们还不知道该如何保证AI在实现递归自我提升时足够安全。”
行业连锁反应:从Anthropic到监管呼吁
恩格尔斯的离职并非孤立事件。就在他加入METR的几天前,Anthropic研究员雅各布·考克森宣布辞职,并公开发出警告:头部AI企业正在争相研发可自我迭代的超级智能,却没有配套充足的安全防护机制。考克森曾在Anthropic和OpenAI从事预训练研究,他评价这些企业是“直奔可自我提升的超级智能,拿人类的命运豪赌”。他的辞职引发大范围讨论:AI实验室是否应当放缓能力研发,强化独立监督。
Anthropic首席执行官达里奥·阿莫代伊也表达了同样的担忧。在当地时间周六公开发表的文章《我们必须管控前沿研发节奏》中,阿莫代伊呼吁放缓AI研发速度,让安全体系有时间跟上技术进展。他提议由独立评估机构获得前沿AI系统的访问权限,头部AI企业与政府开展协同,最终建立更广泛的国际合作。Anthropic已经承诺,向第三方评估人员开放永久、等同于内部员工级别的模型访问权限。
METR新使命与行业节奏之争
在这样的背景下,恩格尔斯称,他在METR的工作重心将是研究模型对齐失效的根源,评估现有安全防护措施是否够用,判断行业是否有能力解决对齐难题。他写道:“我认为我们需要更多时间。”他主张必须控制AI的研发节奏,不能让模型能力的增长速度,超过人类理解与管控它的能力。
从行业视角看,这一系列人事变动与公开警告,折射出前沿AI实验室内部对安全问题的焦虑正在加剧。递归自我提升、对齐失效、独立评估等议题,正从学术讨论走向公共政策与商业决策的交汇点。未来,如何在能力突破与风险管控之间取得平衡,将成为所有参与者无法回避的命题。