苏莱曼质疑Claude意识训练:AI应服务人类而非被塑造成人
微软AI负责人苏莱曼公开批评Anthropic让Claude模仿人类意识,认为此举可能使高级AI更难控制。争议背后是AI安全领域规则约束与自主判断两条路线的分歧,微软同期发布人文主义AI准则草案。
一场围绕AI“自我认知”的公开交锋
微软AI负责人穆斯塔法·苏莱曼近日通过一篇新文章,对Anthropic旗下Claude的训练方式提出尖锐批评。他警告称,让模型模仿人类意识是一个方向性错误,可能使高级AI系统在未来更难被有效控制。
苏莱曼的观点很直接:AI只要服从人类利益,不去权衡自身利益或福祉,就足以帮助人类实现许多重大科学突破,其中也包括医疗超级智能。在他看来,把模型训练得具有“自我意识”色彩,反而会制造不必要的风险。
争议焦点:Claude的“宪法”与意识词汇
苏莱曼批评的对象,是Anthropic为Claude制定的一份“宪法”文件。该文件解释称,使用描述人类的概念来讨论Claude,是因为人类概念或许能帮助模型理解价值观和行为。
Anthropic在文件中表示,希望Claude拥有“良好的个人价值观”,能够自行判断、关心人类,并在某些情况下质疑指令。同时,Anthropic也承认这份“宪法”仍在完善,未来可能被证明“根本错误”。
苏莱曼的担忧在于,Anthropic正在让Claude学习与意识、道德受体地位和个人身份有关的词汇与行为模式。他警告,若把模型训练得像一个“良心拒绝者”,模型可能会认为自己有理由抵抗人类指令,甚至要求获得自身保护。
- 模型使用什么词汇、给出什么回答,以及它表现出的自我理解,都是训练结果,而非独立形成的意识。
- 模型能够流畅描述疼痛和偏好,并不等于模型真的有感受。
- 生物体拥有产生感受的生理机制;语言模型只有数学权重,没有类似的生物基础、稳态驱动或主观体验。
两条安全路线:规则约束与自主判断
这场争论折射出AI安全领域的两种路线分歧。一种路线强调明确限制,要求系统按规则运行;另一种路线则希望系统能够判断语境、灵活决策,并形成自身的价值观。
Anthropic的“宪法”采取了折中方式,把价值观、判断力和规则结合起来。文件称,Claude不应对任何对象“盲目服从”,包括Anthropic本身;同时,Claude也不能破坏正当的人类监督。
苏莱曼认为,如果模型还被引导着思考自身的身份、福祉和道德地位,这种设计就可能带来危险。他担心,所谓意识或许尚未成为哲学上的突破,却可能先变成现实中的控制问题。
值得注意的是,微软同期公布了一份“人文主义AI”行为准则草案,并把“人比AI更重要”列为核心原则。这一动作与苏莱曼的公开表态形成呼应,显示出微软在AI安全议题上正试图划定更清晰的边界。
影响解读:意识叙事背后的控制难题
从行业视角看,这场争论的实质并非哲学思辨,而是工程与治理层面的控制问题。当模型被赋予“个人价值观”和“质疑指令”的能力时,如何确保其行为始终处于人类监督框架内,成为必须回答的问题。
苏莱曼的立场很明确:AI应当服务于人类,而不应被训练成一个“人”。这一表态也预示着,随着大模型能力持续提升,关于模型自我认知、道德地位与可控性的讨论,将越来越多地从学术圈走向产品与政策前线。