谷歌发布两款实时对话模型,97种语言自动切换与推理能力成焦点
谷歌推出Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking两款实时对话模型,前者主打规模部署与成本优化,后者强化多步推理,支持97种语言自动检测切换,并已在多平台开启推送。
当地时间9月15日,谷歌对外发布Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking两款实时对话模型。按照谷歌的描述,这是其当前技术序列中最先进的实时对话产品,核心升级集中在智能水平与并行推理能力两个维度,目标是让AI对话交互更接近自然直觉。
双产品线定位:规模效率与深度推理各司其职
两款模型在功能划分上呈现出清晰的差异化策略。Gemini 3.8 Live面向规模化部署与成本效率场景,在对话智能、交流流畅度以及视觉理解之间寻求平衡,适合对响应速度和单位成本敏感的大规模应用。Gemini 3.8 Live Extended Thinking则瞄准高复杂度任务,重点强化多步推理能力,以更强的智能水平应对需要深度思考的工作流。
从基准测试结果来看,Gemini 3.8 Live Extended Thinking在多个维度取得领先:
- Artificial Analysis语音对语音质量指数总排名第一,得分82.6%;
- τ-Voice智能体任务完成率达68.6%;
- Sierra的τ-Voice-banking基准测试达35.1%;
- Big Bench Audio推理能力得分97.7%。
在保持上述成绩的同时,该模型仍维持了有竞争力的定价策略。Gemini 3.8 Live则在Speech Agent Arena排名第二,用户认可度较高,成本效益表现突出,适合大规模部署。两款模型在ServiceNow EVA-Bench语音智能体基准测试中,均实现了准确性与对话质量之间的平衡,将复杂工作流的帕累托前沿进一步推高。
语言切换与后台任务处理能力升级
Gemini 3.8 Live在交互层面引入了多项实用能力。该模型可近实时处理视觉输入,在对话过程中自动检测并切换97种支持的语言,无需用户手动干预。同时,它能够在后台执行工具与API调用,而对话本身保持流畅不中断,这一特性对需要边聊边查、边聊边办的业务场景具有实际价值。
针对深度推理需求,Gemini 3.8 Live Extended Thinking实现了推理与发言同步进行。模型在复杂工作流中提升智能水平的同时,不会破坏对话的连贯性。它可以通过“让我确认一下…”这类早期语言提示自然回应用户,并实时讲解多步后台任务的处理进度,让原本不可见的推理过程变得可感知。
开发者生态与推送渠道同步铺开
开发者可通过Gemini Live API,在声网、Fishjam、LiveKit、Pipecat、Vercel、Vision Agents等平台构建和部署高性能语音驱动界面。谷歌同时与Salesforce、Genspark、Lumeris等企业展开合作,推进生态建设。
在内容安全方面,谷歌所有AI生成音频均添加了SynthID隐形水印,直接嵌入音频输出,可用于检测AI生成内容,帮助防止虚假信息传播。
推送安排上,Gemini 3.8 Live已开始面向多类用户开放:开发者可在Gemini API和Google AI Studio使用;企业用户可在Gemini Enterprise抢先体验,即将登陆Gemini Enterprise for Customer Experience;全用户可在Search Live体验。Gemini 3.8 Live Extended Thinking同样开启推送:开发者可在Gemini API和Google AI Studio使用;企业用户可在Gemini Enterprise抢先体验,即将登陆Gemini Enterprise for Customer Experience以及Google Workspace企业客户;普通用户可在Gemini Live体验,Google AI Pro和Ultra订阅者可在Google Workspace的Docs使用,所有Google AI订阅者可在Gmail和Keep体验。
行业影响观察
实时对话模型的竞争焦点正在从单一的语言理解能力,转向语言切换、视觉输入、后台工具调用与推理过程可见性的综合体验。谷歌此次以双产品线覆盖不同复杂度场景,并同步推进API生态与终端入口,显示出将实时语音交互嵌入企业工作流和消费级产品的意图。随着多步推理与对话流畅度之间的平衡逐步改善,语音智能体在客服、金融、协作工具等领域的落地节奏可能进一步加快,而音频水印等安全机制的标配化,也将成为行业合规讨论的重要参照。