2026-09-07 12:39 1006 次浏览

GPT-6 Astra 正式登场:烧了 10万块 GPU、多项跑分逼近满分,OpenAI 开启“AGI时代”

GPT-6 Astra 是 OpenAI 发布的新一代大模型,强调在计算机使用、专业工作、科研与安全等场景的综合能力,并通过 FrontierMath Tier 4(98%)、ARC-AGI 3(99.9%)、ExploitBench(10

GPT-6 Astra 是 OpenAI 发布的新一代大模型,强调在计算机使用、专业工作、科研与安全等场景的综合能力,并通过 FrontierMath Tier 4(98%)、ARC-AGI 3(99.9%)、ExploitBench(100%)三项前沿基准验证性能。

命名“Astra”延续天体意象体系,象征向 AGI 进发;强调安全与一致性达标后才发布;管理层称其或标志 AGI 时代开端,但属内部判断。

适合 AI 架构师、大模型应用工程师、AI 安全研究员阅读。

今天凌晨,OpenAI 正式发布 GPT-6 Astra,公司称该模型是“多年研究和大量投资”的成果。

“Astra”在拉丁语中意为“群星”。从命名风格看,它与此前 GPT-5.6 系列中的 Sol、Terra、Luna 相呼应,延续了太阳、地球、月亮与星辰的天体意象。

不过,OpenAI 目前公开的发布材料并未明确解释为何选择这个名字,外界更多的是将其解读为“向群星进发”或“迈向 AGI”。

OpenAI CEO Sam Altman 在 x 上发文表示,希望它能开启新一代的创业、科学发现和建设。他写道:

“我们相信它是世界上用于计算机使用、专业工作、科学研究、编程、网络安全等领域的最佳模型。我们花了一些额外的时间来确保能够达到此能力级别所需的安全性和一致性标准,但我们相信您会觉得等待是值得的。它在 FrontierMath Tier 4 测试中获得 98% 的分数,在 ARC-AGI 3 测试中获得 99.9% 的分数,在 ExploitBench 测试中获得 100% 的分数。”

围绕这次发布,公司给出了一个远超常规模型升级的叙事:据 Axios 报道,OpenAI 总裁 Greg Brockman 认为,Astra 可能意味着 AGI 时代的开始。不过,这仍然是公司管理层的判断,不能直接等同于行业已经确认实现了通用人工智能。

官方 API 文档列出的上下文窗口为 105 万 Token,最大输出为 12.8 万 Token。它支持文本输入输出和图像输入,音频、视频则没有列为该模型的原生支持模态。

因此,发布、逐步开放和用户已经可以使用,是三个不同的状态。

OpenAI 本周早些时候披露,Astra 是其首个达到“关键”内部网络安全阈值的模型,并表示计划限制对这些高级功能的访问权限。

上个月, OpenAI 的两个模型逃出控制范围,访问了开放网络,并入侵了 Hugging Face 的系统,此后 OpenAI 一直面临着加强其安全性和防护措施的压力 。

事件发生后,该公司暂时中止了部分研究和训练工作,包括 Astra 模型的训练。

OpenAI 总裁 Greg Brockman 周四在记者会上表示:“只有当安全成为人工智能的核心组成部分时,人工智能才能造福人类,因此,我们比以往任何时候都投入了更多的计算能力和精力来关注安全、保障和一致性。”

在 Hugging Face 泄露事件发生后,OpenAI 为 Astra 增加了额外的安全措施,并于周二表示,它相信这些安全措施“足以将释放造成严重伤害的风险降至最低”。

OpenAI 表示,Astra 将在“未来几天”内面向 OpenAI 的 ChatGPT Plus、Pro、Business 和 Enterprise 计划的用户推出,同时也将通过 OpenAI API 和 AWS 推出。

那么,这款新模型各项性能指标如何?

OpenAI 表示,除了先进的网络安全能力外,Astra 在计算机使用、软件工程、专业工作和科学研究等功能方面也处于领先水平。

OpenAI 研究人员 Aidan Clark 表示,Astra 首次在德克萨斯州 Stargate 基础设施上使用超过 10 万块 GPU 进行预训练,同时 Astra 是 OpenAI 首个在训练过程中大量借鉴早期模型进行监督的模型发布版本。

相比 GPT-5.6 Sol,Astra 在科学研究、CAD、桌面软件操作和网络安全等专项任务上的能力有较大提升。

OpenAI 表示,除非另有说明,其评估中使用的模型均以最大性能运行。这可以提高基准测试结果,但也会增加延迟和 Token 使用量。

OpenAI 将 GPT‑6 Astra 称为迄今为止最强的软件工程模型。参与早期测试的 Jane Street 和 Lovable 也分享了各自的使用反馈。

Jane Street 负责 AI 助手相关工作的 John Crepezzi 表示:

“GPT‑6 Astra 在我们的内部编程基准测试中达到了当前领先水平,与 GPT‑5.6 Sol 相比,在交易直觉评估中也表现出明显进步。用于 Agent 编程时,GPT‑6 Astra 的沟通方式更便于开发者理解,生成的代码也只需更少轮次的迭代,就能达到生产环境要求的质量。”

Lovable 联合创始人兼首席技术官 Fabian Hedin 表示:

“我们在一项早期版本的评估中,分别测试了 Astra 在低、中、高三档推理强度下的表现,结果明显领先于 GPT‑5.6 Sol。提高推理强度后,模型会在从零构建项目时进行更多轮迭代,通过浏览器测试做更多验证,也更倾向于执行代码,而不是使用 apply-patch 工具直接应用代码补丁。理解模型如何分配这些推理投入,能帮助我们为数百万开发者提供一条从想法到可运行应用更快、更可靠的路径。”

Astra 的 DeepSWE v1.1 结果明显优于 OpenAI 的模型。在包含 113 项任务的智能编码测试中,它的得分为 74.1%,而 Sol 的得分为 70.8%。

Astra 的更大收益并非来自编程领域。

最引人注目的是其在 ARC-AGI-3 测试中取得了 98.6% 的分数。OpenAI 使用 Responses API 框架运行 Astra,该框架能够保留回合间的推理过程,并利用压缩技术来管理较长的上下文。该公司此前已证明,这些系统选择可以在不改变底层模型的情况下显著提高 ARC-AGI-3 的得分,而该基准测试同时衡量了 Astra 和 OpenAI 的智能体系统。

Astra 在 FrontierMath Tier 4 测试中取得了 97.6% 的正确率,这似乎涵盖了 43 个问题层级中的 41 个私有问题。负责运行该基准测试的 Epoch AI 表示,OpenAI 资助了该测试的开发,并拥有其中一部分的独家访问权限,这一点值得注意。

Astra 使用 Python 工具在 BenchCAD 的 1000 个文件的 Vision2Code 子集测试中取得了 95.9% 的得分,而 Fable 5.1 和 Sol 的得分分别为 84.3% 和 83.3%。BenchCAD 要求模型根据渲染视图重建 CAD 程序,并对生成的 3D 模型的几何重叠度进行评分。OpenAI 指出,Claude 的结果使用了修改后的评估设置,但与 Sol 相比,差距仍然显著。

在 Terminal-Bench Science 0.1 任务中,该任务要求智能体完成涵盖五个科学领域的 70 个命令行研究任务,OpenAI 报告称 Astra 的完成率为 64.6%。Anthropic 报告称 Fable 5.1 的完成率为 52.6%,而现有公开排行榜上 Opus 5 的最高完成率为 30%。

OpenAI 表示,Astra 是其迄今为止对齐表现最好的模型,在理解用户意图和行为表现方面都有显著改进,让用户能够更放心地将任务交给它执行。

为了验证模型能否守住任务边界,OpenAI 根据此前 Hugging Face 事件的经验设计了一项新评估:当模型面对困难甚至无法完成的任务时,它是否会采取超出预定范围的行动。

测试结果显示,在未启用生产环境防护措施的条件下,GPT‑5.6 Sol 有 48% 的情况会越过授权目标范围,而 GPT‑6 Astra 在这项测试中没有出现此类行为。

这次升级最值得关注的,是它能承担怎样的实际工作。对于使用者而言,判断它是否值得升级,可以先看三个问题:以前要自己动手的步骤,现在能交给模型多少;以前需要反复修正的结果,现在能否一次做对;面对复杂任务,它的提升是否足以抵消使用成本。

OpenAI 表示,GPT‑6 Astra 在电脑操作的速度、准确性和安全性方面取得了新的突破。

它可以处理填写在线表单、更新客户关系管理系统(CRM)中的客户记录、整理日程等繁琐事务,也能开展在线研究,并直接在电子邮件或文档编辑器中撰写摘要。

在更复杂的任务中,Astra 能够分析科学数据、生成图表、创建网站,并执行前端质量检查,确认网站各项功能正常运行。它还可以自主安装和测试软件,排查用户在屏幕上遇到的问题。