2026-09-11 18:43 1002 次浏览

OpenAI再陷数学成果争议:Astra被指使用学者未公开对话数据

德累斯顿工业大学数学家Andreas Thom指控OpenAI的Astra模型剽窃其二十年研究,核心推导与其未发表对话高度吻合。OpenAI否认,但此前已承认可能使用去标识化客户数据,引发学界强烈反弹。

争议再起:Astra模型被指窃取二十年研究心血

继纽约大学数学家Tristan Buckmaster就纳维-斯托克斯方程归属问题与OpenAI发生冲突后,数学界对这家AI公司的质疑声浪再度升级。这一次,站出来的是群论领域权威、德累斯顿工业大学教授Andreas Thom。他在社交平台公开邮件记录,指控OpenAI新一代模型Astra剽窃了其长达二十年的非sofic群研究成果。

事件迅速发酵,短短数小时内便登上热门讨论榜。OpenAI方面则给出简短否认,但这一回应并未平息外界疑虑。

关键推导高度吻合,未发表对话成焦点

争议源头可追溯至8月初OpenAI的高调发布——其宣称Astra成功攻克十大“菲尔兹奖级”难题,其中包括困扰群论领域27年的Gromov柔度猜想。Astra声称找到了非柔度群的存在证据,一度引发“AGI叩开纯数学发现大门”的欢呼。

然而,深耕该领域二十余年的Thom与其长期合作者Gábor Kun很快发现,Astra证明过程中最核心的推导步骤,与他们正在推进的技术路径高度相似。Thom强调,他们的方法并非攻克该猜想的主流方向,学界当时更看好量子博弈等路径,因此OpenAI模型精准锁定这套冷门技巧的方式令人费解。

谜底指向一段对话记录。在OpenAI发布成果前数月,Thom和同事频繁使用ChatGPT探讨“扩展匹配问题”,并在对话框中输入了大量关于该猜想的未发表核心推导与证明细节。这些持续数月的推演交流,随后似乎变成了Astra震撼世界的“自主成果”。

质询与回应:从“从未发生”到承认去标识化数据

察觉异常后,Thom向OpenAI两位核心研究员Mark Sellke和Sébastien Bubeck发送正式邮件,提出两项质询:

  • 数月来在ChatGPT中讨论未发表成果的对话记录,是否被纳入模型训练数据?
  • 在模型解题推理过程中,这些记录是否可被直接检索和访问?

Sellke的回复极为简短,仅称“关于你与ChatGPT的对话:那没有发生过”,未提供数据审计说明或隐私机制解释。Thom还披露,他于6月29日关闭了模型训练选项,但认为该开关仅面向此后,无法说明更早对话是否已有衍生数据进入训练流程。

然而,仅数周后,OpenAI在千禧年难题“纳维-斯托克斯方程”争端中口径出现反转。面对Tristan Buckmaster和Levent Alpöge的追问,OpenAI虽坚称未调取特定账户私人数据,但承认“无法排除使用来自客户产品的去标识化数据来改进模型”。这一表态与此前对Thom的断然否认形成鲜明对比。

Thom在最新长文中反驳称,去标识化也许能删掉学者名字,但删不掉数学思想的智力内核。

学界反弹与行业影响

从Buckmaster到Thom,接连有顶尖学者公开指控,OpenAI精心构建的“AGI科学神话”正面临严峻考验。Valerio Capraro在长文中呼吁,若这些指控被坐实,可能成为科学史上最大规模的智力掠夺丑闻之一。

这一系列事件也暴露出AI模型训练数据来源的灰色地带:用户与聊天机器人的对话,尤其是涉及未公开研究思路的内容,其边界与归属尚缺乏透明机制。对于依赖原创性发现的学术群体而言,信任一旦受损,可能影响其使用AI工具的意愿。

目前,OpenAI尚未就Thom的指控给出更详细说明。数学界与AI行业都在等待一个真正清晰的交代。