2026-09-11 14:42 1001 次浏览

OpenAI开放GPT-Live-1语音模型API,每分钟0.05美元切入实时交互市场

OpenAI将ChatGPT语音功能背后的GPT-Live-1模型开放给开发者,该模型采用全双工架构,支持实时听取与回应,语音前端定价每分钟0.05美元,后台推理模型另行计费。

从消费级功能到开发者工具:GPT-Live-1正式开放API

OpenAI近日宣布,此前仅服务于ChatGPT语音交互的GPT-Live-1模型已通过API向开发者开放。该模型采用全双工架构,允许开发者在自有应用与业务流程中构建能够实时听取用户讲话并同步回应的语音助手。语音前端部分按每分钟0.05美元计费,若需调用后台推理模型,则依据所选模型的价格另行结算。

与传统的“语音识别—大语言模型推理—语音合成”串行流水线不同,GPT-Live-1能够在接收用户音频的同时生成输出语音。这意味着用户无需等待AI完整表达完毕即可插话、补充或改变意图,模型可依据对话现场动态调整自身行为,判断何时继续发言、何时暂停、何时保持倾听,以及何时调用外部工具。OpenAI方面表示,该架构显著降低了语音交互延迟,并缓解了多模型切换时常见的衔接问题。

性能表现与架构分离设计

在OpenAI公布的测试数据中,GPT-Live-1于Full Duplex Bench评测里较GPT-Realtime-2.1提升30个百分点,尤其在轮流发言延迟与交互行为方面进步明显。当与GPT-6 Astra以中等推理强度配合时,该模型在Tau3测试中位列第一,该测试主要衡量语音智能体完成端到端任务的能力。

值得注意的是,GPT-Live-1并非包揽全部推理工作。OpenAI将实时听说交互与深度推理进行了拆分:当用户提出搜索、复杂分析或长任务需求时,语音模型可将任务转交后台模型处理,同时维持与用户的自然对话。开发者可依据业务场景灵活选择后台模型——预约、订单更新等简单任务可选用更快、更经济的模型,复杂客户问题则交由更强推理模型应对。这种设计让响应速度、推理能力与成本之间形成可调节的平衡,也避免了后台任务执行期间用户面对漫长静默。

应用场景与成本结构

早期落地案例已经出现。OpenAI展示的语音服务包括Yelp Host、Hatch以及语言学习平台Speak。Speak在评估中发现,相较此前基于轮次的语音系统,GPT-Live-1为语言学习者提供了更多思考时间,系统主动打断用户的情况减少近80%。

对企业而言,该能力适用于客户服务、电话客服、预约等需要连续语音交互的场景。GPT-Live-1原生支持电话场景,开发者可借此构建接听和处理电话的全双工语音智能体。模型还提供自动语音识别转写文本与响应文本,增强了对字母数字组合的理解,并支持关键词偏置功能。尽管并非传统轮次式模型,它仍原生支持轮次检测,便于开发者围绕明确对话轮次进行设计。

在嘈杂环境中,GPT-Live-1优化了用户讲话、背景噪声与静默状态的区分能力,减少因环境音频繁打断对话或在用户短暂思考时不断出声的情况。声音选择方面,新版本覆盖更多口音、方言与语言,未来数月还将继续扩充。

部署上,开发者无需将所有任务交给GPT-Live-1。它可作为实时语音交互前端,由后台模型与智能体框架承担复杂工作。例如,语音模型接收请求、维持对话并处理打断,复杂推理交由后台模型,完成后将结果转化为自然语音返回。该机制同样适用于调用外部工具的场景,OpenAI还展示了与Codex等工具结合的方式。

价格层面,GPT-Live-1语音前端每分钟0.05美元仅为实时语音层费用。若配备后台推理模型,实际成本由语音连接时间与后台推理消耗共同构成。开发者可通过选择不同后台模型,按任务复杂度控制整体开支。

行业影响与趋势观察

GPT-Live-1的开放标志着OpenAI将ChatGPT语音模式背后的核心技术从消费级产品延伸至开发者生态。其技术路线试图解决的不只是“让AI说话”,而是让AI参与连续、实时、可打断的自然对话。通过拆分听说交互与深度推理,OpenAI在降低语音延迟、提升对话自然度的同时,保留了后台任务处理能力。

随着语音智能体从简单问答向电话客服、预约、语言教育、业务办理及自主工具调用等复杂任务演进,实时语音模型的重要性持续上升。每分钟0.05美元的语音层定价,使这一能力正式进入商业化应用阶段,也意味着实时语音交互领域的竞争将围绕延迟、自然度与综合成本展开。