2026-09-12 10:43 1002 次浏览

AGI判定标准再引激辩:换套考题,顶尖模型得分大幅缩水

围绕通用人工智能是否已经到来的争论再度升温。一方高调宣称AGI已至,另一方以换考场后模型得分骤降为例提出质疑,事件折射出当前评测体系与真实通用能力之间的落差。

一句“AGI已至”,为何引发当场反驳

关于通用人工智能(AGI)是否已经实现的争论,近期再度成为技术圈关注的焦点。围绕这一话题,一方在公开场合释放出相当乐观的信号,认为当前的大模型能力已经触及AGI的门槛;而另一方则以评测结果为依据提出质疑,认为在更换测试题目或评测环境后,同一模型的表现会出现明显回落,远谈不上“通用”。

争议的核心并不在于某一次具体得分,而在于“AGI”这一概念本身长期缺乏统一、可验证的判定标准。当不同机构各自采用不同的题库、提示方式和评分口径时,结论自然容易出现分化。此次“换个考场分数骤降”的说法之所以引发共鸣,正是因为它触及了一个被反复讨论却始终未获解决的问题:模型在熟悉题型上的优异表现,究竟在多大程度上代表了跨领域的通用推理能力。

评测分数的“考场效应”

从近年的大模型评测实践来看,模型成绩对测试条件高度敏感已是不争的事实。影响得分的因素通常包括:

  • 题目是否出现在训练数据分布之内,即所谓的数据污染问题;
  • 提示词的组织方式、是否提供示例、是否允许多轮追问;
  • 评分标准是严格匹配还是语义近似,是否引入人工或模型辅助评判;
  • 任务类型偏向知识回忆,还是需要多步推理与外部工具协同。

因此,同一模型在不同基准上的排名出现大幅波动,并不罕见。高分往往集中在结构清晰、答案唯一的标准化测试上,而一旦切换到开放式、跨学科或需要长期规划的任务,表现便可能明显下滑。这种落差被形象地概括为“换个考场就掉分”,也成为质疑AGI已至的重要论据。

厂商叙事与工程现实之间的张力

在产业层面,头部厂商对AGI的时间表表述并不一致。部分企业倾向于将AGI描述为渐近过程,强调模型在编码、数学、多模态理解等单项能力上的快速提升;也有观点认为,真正的通用智能应具备持续学习、自主设定目标以及在陌生环境中稳定泛化的能力,而这些恰恰是当前系统的短板。

围绕OpenAI、微软、谷歌、Meta等公司的相关讨论中,能力演示与基准测试常被用作论据,但演示场景通常经过筛选,难以完整反映模型在长尾任务上的可靠性。与此同时,面向开发者的API与云平台,如阿里云、腾讯云、AWS等所提供的模型服务,更多以稳定性、成本和可控性为卖点,而非直接宣称达到AGI。这种务实取向,与部分高调表述形成对照。

争论背后的真正问题

无论立场如何,这场争论都指向同一个现实:评测体系需要同步进化。若基准题目被广泛用于训练,其区分度会迅速衰减;若只依赖少数高难度测试,又难以覆盖真实应用的多样性。更可行的路径,或许是建立动态更新的评测集合、引入对抗性出题机制,并对模型在分布外任务上的表现给予更高权重。

对技术人员与站长群体而言,与其纠结于“是否已到AGI”的标签,不如关注具体场景下的可用性:模型在目标语言、目标领域、目标成本约束下能否稳定交付结果。AGI的定义之争短期内难有定论,但评测方法、数据治理与工程落地能力的差距,将持续决定各家产品在真实业务中的表现。