OpenAI 推出 GPT-6 Astra:从生成回答迈向直接操作软件
OpenAI 发布 GPT-6 Astra,聚焦编程、专业工作流与图形界面交互,OSWorld 2.0 得分 72.6%,并首次被列为关键网络安全能力级模型。
OpenAI 近日推出新一代多模态智能体模型 GPT-6 Astra,定位从单纯的文本生成转向直接在软件环境中执行多步骤任务。该模型面向编程、专业工作流、科学计算与网络安全等场景,最初仅向部分组织开放,随后逐步覆盖 ChatGPT Plus、Pro、Business 和 Enterprise 用户,以及 OpenAI API、Microsoft Azure 与 AWS Bedrock 渠道。
从对话到操作:端到端软件交互能力
Astra 的核心变化在于将模型能力从“生成响应”推进到“执行操作”。它可以与图形界面交互,完成填写表单、更新 CRM 记录、开展研究、搭建网站、分析数据、安装与测试软件,以及诊断能够从屏幕上直接观察到的故障。在 OSWorld 2.0 评估中,OpenAI 报告该模型准确率达到 72.6%,高于 GPT-5.6 Sol 的 65.7%。
编程是此次发布的另一重点。Astra 在 Terminal-Bench 4.0 上得分 57.9%,在 DeepSWE v1.1 上得分 74.1%。同时,Codex 中引入了一种实验性的跨窗口上下文笔记机制,使智能体能够在不同上下文窗口之间保留笔记,而不再单纯依赖压缩机制。此前的上下文窗口仍可被搜索,模型因此能在长时间运行的编程任务中回溯早期需求、测试结果与工具输出。
长上下文与专业任务表现
在 OpenAI 公布的 MRCR 评估中,Astra 支持长达 100 万个令牌的上下文,在 512K 至 1M 区间得分达到 96.3%。OpenAI 还表示,该模型在数据库迁移、CAD 生成、数据科学、浏览器研究和科学工作流等专业任务上均有提升。内部评估显示,Astra 的幻觉率为 4.2%,低于 GPT-5.6 Sol 的 12.2%。
不过,在测试模型是否会掩盖推理过程时,OpenAI 发现 Astra 的书面推理比前代模型更难监控,提升可监控性仍是当前研究重点。
网络安全定级与竞争格局
网络安全方面,Astra 成为 OpenAI 依据 Preparedness Framework 首个被归类为“关键网络安全能力”级的模型。OpenAI 称,在未启用生产环境安全防护的测试中,该模型发现并利用了此前未知的两个漏洞,同时展示了针对强化防护的浏览器和操作系统开发漏洞利用程序的能力。生产版本对高级攻击任务进行了限制,OpenAI 计划通过 Daybreak 计划提供更广泛的防御能力。
竞争层面,Astra 的对手包括 Anthropic Claude Fable 5.1 和谷歌 Gemini 3.8 Flash。OpenAI 公布的评估结果显示,不同模型在不同任务上各有优势:Astra 在 Terminal-Bench 4.0 及多项计算机使用评估中领先;Claude Fable 5.1 在 Humanity's Last Exam 中得分更高;Gemini 3.8 Flash 支持原生视频和音频输入,而 Astra 暂不支持。
社区反响中,英伟达首席执行官黄仁勋重点提及训练基础设施,称 GPT-6 Astra 在 10 万多块 NVIDIA Grace Blackwell NVLink72 上完成训练,并表示从 ChatGPT 到 o1 再到 Astra 仅用了 4 年,接下来将有 40 万块 GPU 投入使用。另一位社区代表 Alex Finn 则聚焦于此次发布所体现的 AGI 框架。
整体来看,Astra 的发布标志着智能体模型正从“辅助生成”向“直接操作”演进。端到端软件交互、长上下文记忆与跨窗口笔记机制,正在重新定义开发者工具与企业自动化的边界。与此同时,关键网络安全能力定级与推理可监控性问题,也提示行业在推进能力落地的同时,需要同步建立更细粒度的安全与治理框架。