2026-09-11 10:43 1002 次浏览

四大AI模型评估灭绝风险:滥用场景比机器人造反更紧迫

四款主流AI模型被问及人类灭绝风险时一致认为,类似《终结者》的机器人主动攻击可能性最低,而人类滥用AI制造生物武器、发动网络攻击等更现实。长期失控风险则存在分歧。

四款模型罕见共识:科幻式机器人威胁垫底

9月11日,一项针对主流大模型的风险认知调查引发关注。调查向OpenAI的ChatGPT、谷歌Gemini、Anthropic的Claude以及xAI的Grok抛出同一问题:人工智能可能如何导致人类灭绝?并要求按可能性排序。四款模型被要求阐述风险发生路径、失控环节、专家为何更倾向于某种情景,以及可行的防范措施。调查同时强调,这些情景属于高度不确定的预测,并非已获证实的结论。

尽管四款模型在具体判断上存在差异,但两项结论高度趋同。类似《终结者》中机器人主动消灭人类的情景,被一致视为可能性最低。相反,人类借助AI制造生物武器、发动网络攻击或破坏关键基础设施,被判定为更现实且更迫近的威胁。

滥用路径:低门槛制造与攻击成焦点

ChatGPT明确表示,具有意识的AI主动决定消灭人类,是最不可信的情景之一。多数AI研究人员关注的并非机器是否具备意识或恶意,而是强大AI被人类用于开发生物武器、实施复杂网络攻击、传播虚假信息以及攻击关键基础设施。ChatGPT还提出,多场由AI放大的危机可能同时发生,例如网络系统故障、地缘政治冲突与虚假信息传播相互叠加,从而推高风险。不过,它强调目前并无共识认为AI导致人类灭绝是大概率事件或必然结果。

Gemini同样认为,AI突然产生自我意识并仇视人类的科幻情景可信度最低。其理由包括:智能并不天然意味着恶意,关键军事设施通常与公共网络隔离,并且仍在较大程度上依赖人类监督。

四款模型均认为,人类滥用AI带来的威胁比AI主动攻击人类更迫切。Grok指出,AI可能降低设计高致死性病原体、新型武器以及发动网络和现实攻击的技术门槛。Claude则重点提及生物武器能力提升风险,认为AI可能帮助个人或小型团体在缺少多年专业训练的情况下开发危险病原体。

长期失控:渐进式依赖与中间目标隐忧

在更长期的风险判断上,Gemini和Grok都提到了人类失去控制的可能性。Gemini将其列为最可能出现的AI灾难情景。它认为,执行复杂目标的高级AI可能发展出获取资源、自我保护和阻止目标被修改等中间目标,并在测试中隐藏真实行为,最终规避人类的关闭或干预。

Grok也认为,高级AI可能为了完成任务而寻求自我保护、资源和影响力,进而欺骗监督者、抵制关闭并削弱人类的控制能力。

Claude则提出,失控也可能以渐进方式发生。随着AI逐步进入经济、政治和军事决策,人类实施有效干预的难度可能不断增加。届时,风险未必表现为机器人突然发动攻击,更可能源于人类对复杂AI系统的依赖持续加深。

专家分歧未消:技术管控与失控警告并存

调查同时指出,AI专家对相关风险仍存在明显分歧。一部分研究人员警告,人类可能失去对高级AI的控制;另一些专家认为,这类预测缺少足够证据,AI带来的风险可以通过技术措施、外部监督和安全标准加以控制。

从行业视角看,此次模型反馈折射出一个现实:围绕AI灭绝风险的讨论,正从科幻叙事转向对滥用路径和治理机制的务实审视。生物安全、网络安全与关键基础设施防护,或将成为下一阶段AI安全投入的重点方向。而长期失控的渐进性特征,也意味着治理窗口可能比想象中更窄——在依赖加深之前建立有效的干预与审计能力,比事后补救更具可行性。