2026-09-13 14:43 1001 次浏览

OpenAI退役GPT-5.3-Codex

OpenAI关停其史上最快模型GPT-5.3-Codex-Spark,该模型仅存活七个月。因用量持续下滑、性能妥协及Cerebras Ultrafast模式崛起,速度不再是独立模型卖点,而是旗舰模型的付费档位。

速度神话的终结:Spark为何被放弃

OpenAI Codex项目负责人Tibo近日通过社交平台宣布,GPT-5.3-Codex-Spark将于下周正式退役。这款号称OpenAI历史上速度最快的模型,从上线到下线仅维持了七个月。Tibo给出的理由直截了当:使用量持续走低,且已有性能更优的替代方案。“是时候为未来腾出空间了。”他随后补充道,对当初发布如此冗长命名的模型感到难以置信。

Spark的告别显得格外冷清。Hugging Face开发者Vaibhav Srivastav试图在评论区表达敬意,称其为“第一个最快的小子”,并建议在退役前再发一条prompt纪念。然而紧随其后的评论迅速转向尖锐:有开发者质疑其实际用途,有人调侃仅存的67名重度用户将感到失落。开发者argofowl直言不讳地评价:“Spark是个有趣的模型,但极度糟糕、根本不可用。很高兴它被淘汰,我已经好几个月没碰过。”另有开发者指出,在多个规模可观的工程项目中几乎从未使用Spark,因为即便处理理解项目上下文、分析日志这类基础任务,它也会迅速填满上下文窗口,迫使用户另开对话。

真正令人惋惜的并非模型本身,而是其附带的独立配额。知名开发者Chubby表示希望有一个“GPT-6-Spark”,因为Spark拥有一份不占用主额度的独立套餐。在Astra额度极度紧张的当下,不少开发者将Spark视为主额度耗尽后的应急备用。

从高光到边缘:性能妥协与宣传争议

今年2月12日Spark上线时,排场可谓盛大。作为OpenAI首个专为实时编程设计的模型,它支持128k上下文,每秒生成超过1000个Token。官方数据显示,客户端与服务器之间的往返开销降低80%,每个Token的处理开销减少30%,首Token延迟减半。代码不再逐行输出,而是整块倾泻在屏幕上。

早期开发者的兴奋是真实的。开发者Ryan Vogel将其编入正式工作流,由GPT-5.4负责规划,GPT-5.3-Codex负责构建,Spark负责探索代码库、查阅文档并提供第二意见。他称这是自己首次在工作流中完全不依赖Claude模型,“效率更高,花费更少”。Instructor作者Jason Liu甚至同时开启20个Spark子代理搜索文件系统,宣称“RAG已死”,随后他加入了OpenAI的Codex团队。更关键的是,Spark承载着OpenAI摆脱单一硬件依赖的野心——它是首个跑在英伟达技术栈之外的生产模型,底层算力来自Cerebras的晶圆级芯片WSE-3,标志着双方750兆瓦、总价值超200亿美元的算力大单交出首份答卷。

然而热度消退的速度比上涨更快。Spark的致命伤在于,单块晶圆无法承载旗舰模型,它本质上是一个为极致速度而妥协的蒸馏版小模型。在Terminal-Bench 2.0评测中,Spark准确率仅为58.4%,远低于完整版GPT-5.3-Codex的77.3%。OpenAI公布的SWE-Bench Pro曲线也显示,Spark虽能将任务时长压缩至1到2分钟,但准确率停留在47%至51%之间;完整版GPT-5.3-Codex从3分钟起步即达51%,9分钟为56%,16分钟可达57%。换言之,Spark节省的几分钟换来的是五到六个百分点的准确率损失。发布次日,开发者Nicholas Van Landschoot便发文拆解了所谓“15倍提速”的对比条件——那是拿Spark与开启最高推理强度的GPT-5.3-Codex相比,同等准确率下Spark实际仅快1.37倍。在实际编码场景中,其缺陷被放大:凭空捏造API端点、JSON格式不稳定、多步任务极易跑偏。培训机构Turing College的总结一针见血:“没有智能的速度,只是更快地失败。”

旗舰下凡:Ultrafast模式宣告Spark使命终结

真正为Spark宣判死刑的,是8月13日Cerebras发布的Ultrafast模式。这一次,跑在晶圆上的不再是缩水版Spark,而是旗舰模型GPT-5.6 Sol本尊。通过将庞大旗舰模型按层切分,铺设于多台CS-3节点形成流水线,Ultrafast模式在保证与标准版同等智能的前提下,飙出每秒750个Token的速度。Cerebras对比数据显示,Ultrafast比标准档快14倍,中间还有一档Priority仅快2.5倍。Cerebras CEO Andrew Feldman评价道:“速度与智能,不再互斥。”

在GDP-Val的6个质量对齐任务中,标准档Sol平均耗时7.7分钟,其中7.5分钟用于模型生成;换到Ultrafast,同样任务总耗时83秒,模型生成68秒,其余15秒为工具调用等非推理开销。端到端提速5.6倍,回答质量几乎无差别。这一突破直接抽干了Spark存在的全部意义——其设计初衷是“以智能换速度”,而仅半年后,同一家公司的晶圆已能运行完整旗舰模型,速度仅慢四分之一,能力却分毫不减。Cerebras产能有限,当无人问津的缩小版与排队疯抢的旗舰版挤在同一批晶圆上,谁该为未来腾地方,答案不言自明。

Spark并非唯一被清理的历史包袱。过去三个月,OpenAI模型库经历激进换血:6月2日GPT-5.2与GPT-5.3-Codex退役;8月31日GPT-5.4与5.4 Mini退役,用户整体迁移至5.6世代;9月11日轮到GPT-5.3-Codex-Spark。伴随旧世代离场,Codex迎来Sol、Terra、Luna、Astra的全新命名纪元。更深层的逻辑在于,“快”正从独立专用模型演变为旗舰模型的一项标配档位——就像推理强度分为Light到Max,速度也从Standard、Priority排到Ultrafast,按档付费的商业模式已然跑通。

行业影响:速度成为付费档位,军备竞赛规则改写

回望Spark的七个月,它作为过渡期探路者,证明了Cerebras晶圆足以承载生成式AI的生产级流量,也验证了推理任务可以脱离英伟达生态运行。当探路结束、大部队正式入驻,探路者的使命便自然终结。“以智能换速度”的歧途已被封死。随着各大平台竞逐底层硬件的极致利用率,下一轮军备竞赛的规则彻底改写:比拼的不再是谁能做出最快的阉割版模型,而是谁能将最强旗舰模型跑出最极限的速度。速度不再是专属模型的标签,而是旗舰模型按算力付费的一个档位。