AI基准测试争议升级:谷歌与Meta被指优化得分
谷歌与Meta被曝在AI跑分中采取针对性优化策略,引发业界对基准测试真实性的讨论。华裔高管回应称OpenAI亦有类似行为,但未提供具体证据。
基准测试争议浮出水面
近日,科技行业围绕AI模型性能评估的讨论再度升温。有消息指出,谷歌与Meta在参与某些公开基准测试时,可能采用了针对性的优化手段,以提升排名表现。这一行为被部分观察者称为“跑分作弊”,即并非完全依靠模型自身的泛化能力,而是针对测试集特点进行调优,从而在榜单上获得更亮眼的数据。
此类争议并非首次出现。随着大语言模型竞争白热化,各大厂商在MMLU、HumanEval等基准上的分数成为外界衡量技术实力的重要标尺。然而,当测试分数与实际应用体验出现落差时,关于测试方法有效性的质疑便随之而来。此次针对谷歌与Meta的指控,再次将行业潜规则暴露在聚光灯下。
华裔高管的回应与行业生态
面对外界的质疑,一位谷歌华裔高管在内部或公开场合回应称,OpenAI在模型评测中同样存在类似做法,暗示这已是行业普遍现象。该回应并未提供具体证据,也未直接否认针对谷歌的指控,而是试图将问题普遍化,以转移舆论焦点。这种回应方式在科技巨头面临伦理质疑时并不少见,但往往难以平息争议,反而可能引发更多关于透明度和诚信的拷问。
事实上,为在竞争中占据优势,不少AI实验室会采用“测试集污染”或“针对性微调”等手段。例如,在模型训练数据中混入测试样本,或针对已知测试题目进行优化。这类行为虽然可能在短期内提升榜单排名,却可能削弱基准测试的真实意义,使得评估结果无法客观反映模型在真实场景中的能力。
基准测试的信任危机与未来方向
此次事件折射出AI基准测试面临的信任危机。当头部企业被曝出疑似作弊行为,整个行业的评估体系都将受到质疑。对于依赖这些分数进行技术选型或投资决策的开发者与机构而言,虚假的高分可能带来误导,甚至影响AI技术的健康发展。
业内专家呼吁,应建立更严格的评测流程,例如采用动态生成的测试集、由独立第三方进行盲评,以及要求参赛方公开模型权重或详细技术报告。同时,模型提供方也应主动披露训练数据来源和评测细节,以增强透明度和可复现性。唯有如此,基准测试才能回归其衡量真实能力的初衷,而非成为公关宣传的工具。
目前,谷歌与Meta尚未就此事发布正式声明,OpenAI也未对相关言论作出回应。随着AI竞赛的深入,如何构建公平、可信的评估环境,将成为整个行业必须面对的重要课题。