2026-09-19 14:42 1042 次浏览

盲测平台惊现神秘模型,谷歌旗舰迭代节奏引发猜想

大模型盲测竞技场出现名为gemini-3.8-flash的异常模型,实测能力明显超出正式版Flash,社区猜测其为尚未发布的Gemini 4 Pro。伴随跑分图与后端截图流传,谷歌在递归自我改进方向的布局同步浮出水面,而此前业界关于放缓前沿AI研发节奏的讨论再度面临考验。

盲测平台冒出“超规格”Flash

过去几个月,OpenAI与Anthropic接连更新旗舰模型,谷歌方面却把重心放在Flash系列上,3.6、3.7、3.8以近乎三周一版的节奏推进。代表能力上限的Pro线始终没有新型号落地,这种反差让开发者对谷歌的下一步动作格外敏感。

转折出现在大模型盲测竞技场Arena。一个挂着gemini-3.8-flash名称的模型悄然上线,但上手实测的开发者很快发现,它的表现与已正式发布的Gemini 3.8 Flash并不在一个层级。写代码、生成SVG、执行Agent任务,多项能力都出现明显跃升。

由于正式版3.8 Flash已经公开,参照物现成,这个匿名模型的异常表现迅速引发猜测:它很可能是谷歌藏在标签之后的下一代旗舰——Gemini 4 Pro。

实测表现与流传数据

最早一批传播集中在SVG、网页和3D场景。开发者Harshith让该模型用SVG绘制一只侧面的家猫,并与GPT-6 Astra Max及正式版Gemini 3.8 Flash并列对比,轮廓、比例与细节完整度均拉开肉眼可见的差距。

  • X网友@thtbee_连续测试多个场景:Voxel风格宝塔耗时约8分钟,生成一整套可交互3D场景;空客H145直升机约10分钟搭出完整3D展示页面,但页面底部UI被指“看起来有点糟”。
  • 网页设计任务中,模型约14分钟完成一套单色主题网站,整体干净完整,过去常被吐槽的设计品味问题似乎有所改善。
  • 网友@Mr_Salio直接用它做游戏,成品画面流畅,世界生成与游戏设计完成度较高。

更关键的线索来自开发者Qwinah。他声称成功“幽灵路由”到Gemini 4 Pro后端,并贴出一张疑似内部终端信息截图。按其说法,模型内部标识出现G4P-ARGON与VIA_3.8_FLASH,最大输出256K,上下文窗口超过1000万token,还带有跨会话永久记忆、无需API即可联网、后端自动编译运行脚本,甚至物理机器人控制等能力。

与此同时,一张benchmark对比表在社区疯传:DeepSWE v1.1拿到88.7%,Terminal-Bench 2.1达到95.3%,HLE-Verified冲到72.1%,OSWorld 2.0达到86.8%,GDPval-AA v2被写成2064 Elo,突破2000大关。若数据属实,其位置将直接站上前沿模型之巅。

但越夸张越需谨慎。这张benchmark表与Qwinah的后端截图并不完全对得上,表中作为对照项的Astra得分也不符合官方数据,两份材料均无谷歌、Arena或相关benchmark官方背书。目前能被确认的,只有那个名为gemini-3.8-flash的模型,以及完全不符合Gemini 3.8 Flash的表现。

Pro线空窗与RSI线索

社区迅速把答案指向Gemini 4 Pro,还有一个重要背景:谷歌的Pro模型已经空窗太久。Gemini 3.5 Pro迟迟没有正式落地,Gemini 4早已确认进入训练,Flash一代代往前推,真正代表能力上限的Pro线始终没有新型号出现。于是猜测越来越像样——谷歌可能根本没打算把真正的大升级留给3.5 Pro,直接憋到了Gemini 4 Pro。

比传闻更值得注意的,是谷歌在AI参与模型研发上的明显提速。RSI,即递归自我改进,在这次传闻中被反复提及。简单说,就是AI开始参与制造更强的AI,而更强的AI又进一步加快下一代模型的研发。一旦循环跑起来,被加速的不只是模型能力,还有模型进化的速度本身。

路透社今年8月披露,谷歌联合创始人Sergey Brin近几个月一直在推动Gemini提速,并把递归自我改进列为重点关注方向之一。谷歌尚未公开宣布实现这一闭环,但正把越来越多原本属于研究员的工作交给Agent,包括评测模型、寻找改进方向、跑实验,再把结果反馈回研发流程。9月2日发布Gemini 3.8 Flash时,官方说明也提到,一套长期运行的Agent循环正在“递归地评估和改进底层模型”。

Google DeepMind研究员姚顺宇在3.8 Flash发布后,化用阿姆斯特朗登月时的话形容这次更新:“这是模型的一小步,RSI的一大步。”9月14日,谷歌、GDM等团队发布Dream-RSI,专门研究如何让Agent通过不断改进探索策略实现递归自我改进,在算法工程、数学优化和GPU kernel任务上显示出更高的探索效率和更低的搜索成本。

RSI这条路显然不只谷歌在走。美国时间9月17日,Anthropic公开一组内部AI研发自动化数据:截至今年8月,Claude已能主导26%的Anthropic AI研发任务,人类只需给出高层目标并监督;这一比例在今年2、3月还不到1%。同时,Anthropic内部超过90%的AI研发任务至少已进入AI协作阶段。国内,智谱创始人兼首席科学家唐杰表示:“我们仍远未达到递归自我改进,但最小的循环已经出现:模型优化系统,系统服务模型。”智谱公开的工程实践中,由GLM-5.3驱动的Infra Agent参与了GLM-5.3-Flash推理基础设施的设计、调试和优化,系统运行在超过10万张国产AI芯片组成的集群上,从第一次跑通到承接全部生产流量只用两周,端到端吞吐提升到初始水平的3.2倍。

减速共识为何难以落地

就在几天前,阿莫迪还呼吁前沿AI公司携手“减速”,并列出第一个需要警觉的条件就是RSI。模型进步本身是好事,但如果AI开始参与制造下一代AI,进步速度可能越来越快,人类理解、评估和控制它的速度未必能同步。阿莫迪反复强调,要在能力跨过某些门槛之前,把第三方评测、共同安全标准和减速机制提前建立起来,因为一旦RSI形成正反馈,模型可能已经越过刹车的“安全距离”。

在风险上,几家前沿实验室确实有共识。奥特曼公开认同“放慢前沿AI的发展节奏”,并承诺OpenAI会引入拥有类似员工权限的独立评测者;马斯克表示“Dario是对的”;哈萨比斯也称这是正确方向,只是具体怎么做还需继续讨论。但那篇倡议也提到,单独减速没有意义,如果AI研发继续被AI加速,未来真正有效的减速或暂停,需要先建立共同规则,比如引入独立评测者,以及让前沿实验室共同设定能力门槛和安全措施,必要时协调放慢研发速度。

到现在,出于各种竞争原因,共同规则并没有被建立。一起说“应该谨慎”并不难,可一到“具体怎么减速、谁先减、其他国家减不减”,共识就迅速消失。盲测平台里那个身份不明的模型,恰好把这种张力摆到了台面上:技术迭代的惯性仍在加速,而约束它的框架尚未成形。