2026-09-11 08:42 1003 次浏览

OpenAI 将 GPT-Live-1 推向 API 市场,实时语音交互迎来全双工新阶段

OpenAI 宣布 GPT-Live-1 正式登陆 API,支持全双工对话、打断处理与电话智能体。前端语音层每分钟 0.05 美元,早期测试中误打断减少近 80%,代码量缩减 80%。

从轮次到全双工:实时语音模型进入 API 生态

OpenAI 近日将 GPT-Live-1 正式引入 API 接口,开发者可基于该模型构建实时语音交互应用与业务流程。与传统的轮次式语音系统不同,GPT-Live-1 采用全双工架构,能够同时接收和输出语音信号,并在对话过程中动态处理打断、停顿以及背景噪声。这意味着语音交互不再需要等待一方完全说完再响应,而是更接近人类自然对话的节奏。

该模型将语音理解与语音输出整合在同一个模型内部,减少了传统链路中“语音转文字—大语言模型—文字转语音”的多次衔接环节,从而有效降低端到端延迟。对于需要复杂推理和工具调用的场景,GPT-Live-1 支持将这部分任务交由后端文本模型处理,形成前端语音层与后端智能层的分工协作。

电话场景与智能体工作流成为重点方向

GPT-Live-1 明确支持电话通道,可用于预订餐厅、客户服务等全双工语音智能体场景。OpenAI 表示,开发者可以将其与 Codex 等工具连接,也能通过 OpenAI Presence 构建能够查询企业系统、执行获批操作并在必要时转交人工的语音工作流。这一能力将语音智能体从简单的问答交互推向企业级任务执行层面。

在配置灵活性方面,开发者可通过系统提示词调整模型的语气、语速和对话风格,同时可自定义后端模型、工具及智能体框架。GPT-Live-1 还具备原生语音识别转写和回复文本生成能力,并支持字母数字理解、关键词偏置及轮次检测,为不同行业场景的定制化部署提供了基础。

早期评测数据与成本结构

在早期评估中,语言学习平台 Speak 使用 GPT-Live-1 后,学习者在思考停顿期间的误打断次数较此前基于轮次的系统减少近 80%。医疗服务平台的联合创始人兼首席技术官 Tony Stoyanov 表示,其团队将代码量减少了 80%,删除约 2.3 万行代码。这些数据从侧面反映出全双工模型在降低工程复杂度和提升交互自然度方面的潜力。

OpenAI 公布的评测结果显示,GPT-Live-1 在 Full Duplex Bench 测试中的表现比 GPT-Realtime-2.1 高出 30 个百分点;在搭配 GPT-6 Astra 中等推理强度时,该模型在 Tau3 端到端语音智能体任务测试中排名第一。

目前 GPT-Live-1 已在 API 中提供,前端语音层价格为每分钟 0.05 美元。按每小时 60 分钟计算,单纯前端语音层的费用约为 3 美元,后端模型和智能体工具的费用另行计算。这一定价策略将实时语音能力的成本门槛进一步明确,便于开发者评估规模化部署的可行性。

语音选项扩充与生态影响

OpenAI 同时扩大了实时语音选项,新增 Quartz、Ripple、Vesper、Willow、Stone、Gleam、Meridian、Bossa、Tempo、Beacon、Delta 和 Cinder 等声音,并计划在未来数月继续增加语音和语言支持。这一举措表明,实时语音 API 市场正从单一模型能力竞争转向声音多样性、语言覆盖和工程易用性的综合比拼。

从行业视角看,GPT-Live-1 的 API 化意味着全双工语音交互不再是大厂内部实验,而是逐步成为可被中小开发团队调用的基础能力。电话客服、语言学习、医疗问诊等对实时性和自然度要求较高的场景,可能率先受益。不过,后端模型与工具调用的额外成本、以及不同语言环境下的识别稳定性,仍是开发者需要在实际部署中权衡的因素。