语音Agent不再尴尬静默:谷歌双模型上阵,异步推理能否撑起实时交互?
谷歌发布Gemini 3.8 Live与Extended Thinking两款实时语音模型,通过后台异步推理与并行工具调用,试图消除语音Agent执行任务时的沉默断点,并引入视觉输入与97种语言支持。
双模型分工:低延迟与深度推理各司其职
谷歌近日推出Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking两款实时对话模型,称其为迄今最先进的实时语音交互方案。两者均通过Gemini API和Google AI Studio向开发者开放,但在定位上形成互补。
Gemini 3.8 Live强调低延迟与规模化部署,适合多数对响应速度敏感的语音应用;Extended Thinking则面向需要多步骤推理、跨多个接口调用的复杂场景,在后台增加思考能力。谷歌将思考深度划分为低、中、高三档,供开发者按任务复杂度调节。
破解“静默等待”:异步工具调用维持对话流
语音Agent长期面临一个尴尬:用户要求查数据、调系统或预约服务时,对话常因等待工具返回而中断。文字界面尚可显示“处理中”,语音通话里的几秒沉默却让人难以分辨助手是在思考、执行,还是已经掉线。
Extended Thinking的解法是把规划与工具调用挪到后台异步执行,同时先给出“我来查一下”之类的语音反馈。任务推进过程中,模型还能口头播报进度,最后再输出结果。例如比较航班与酒店时,Agent可分别查询相关服务,全程保持对话,而非等所有接口返回后才首次开口。
这改变了开发者判断“一轮对话结束”的方式。普通实时语音模型说完一段话通常意味着本轮响应完成;Extended Thinking可能已说完进度提示,却仍在后台推理或等待工具结果。开发者需依据Live API返回的IN_PROGRESS和IDLE状态判断任务是否真正结束。技术文档还规定,Extended Thinking的工具调用必须采用非阻塞方式。
视觉输入与多语言:从“听得懂”到“看得见”
两款模型不仅处理语音,还支持视觉输入。Gemini 3.8 Live能在近乎实时的对话中解析用户展示的画面,并结合语音问题作答。官方演示了模型一边观察棋盘、一边与用户交流棋局的能力,并支持在对话中识别与切换97种语言。
面向业务场景,开发者博客列出几项能力:识别确认码、保险理赔编号等字母数字混合信息;将实时音频与结构化数据结合以更新回答上下文;在持续输出语音的同时执行API调用。电话客服、现场支持等场景中,模型既要听懂问题,也要准确读取编号、理解现场画面,并与企业系统交互。
不过,实时视觉输入也带来输入量管理问题。谷歌提示,视频帧默认会发送给模型,应按需提供画面以控制上下文占用和费用。两款模型均支持文字、图像、音频和视频输入,模型页面列出的输入上限为131072 Token。它们支持函数调用,但模型文档并未将代码执行、文件搜索或结构化输出列为支持能力。
评测数据与用户反馈:能力进阶,争议犹存
根据评测机构Artificial Analysis的语音到语音榜单,Gemini 3.8 Live Extended Thinking的High配置取得82.6分综合指数。该指数汇总语音推理、Agent任务表现、用户偏好和任务成功率,82.6是指数分数,并非百分位。具体项目中,该模型在τ-Voice Agent任务测试中取得68.6%,在Big Bench Audio语音推理测试中取得97.7%。谷歌还披露,它在Sierra的τ-Voice-banking银行业务任务测试中取得35.1%。基础版Gemini 3.8 Live则在Speech Agent Arena用户偏好榜中排名第二。
这些数据表明,语音模型竞争已不止于“说得自然”。Big Bench Audio检验模型能否理解并回答以音频提出的推理问题;τ-Voice关注语音Agent执行任务的能力;用户偏好测试衡量实际交谈体验。但单项成绩不能直接推算企业部署后的完成率,开发者仍需结合自身工具、数据和真实对话流程进行测试。
成本同样是落地关键。谷歌将两款3.8 Live模型列在同一标准价格项下:付费档音频输入约0.005美元/分钟,音频输出约0.018美元/分钟;文字及图像、视频输入另有计费项目。持续收听、生成语音和处理画面的实际用量,都会影响最终费用。
模型发布后在社交平台引发热议。在x上,网友Mike Kipruto表示最想知道模型“能否在后台运行任务的同时进行推理、使用工具,并让对话继续进行”。也有用户表达对模型质量的更高期待,KUMAR希望未来Gemini 4或4 Pro减少设计内容中的“AI味”与幻觉;Francesca A则认为用户需要一款能与Claude、OpenAI模型乃至Kimi 3相比的Pro或前沿模型。可用性方面,Pear称Gemini 3.8 Flash High在过去两天“无法正常工作”,TLM13则抱怨Google Studio反复尝试修复问题直至用完额度。
在Reddit,讨论聚焦于谷歌接连推出Flash、Live等模型却未发布新版Pro。用户technopixel12345猜测:“他们要么藏着一个强大的Pro模型,要么就是远远落后了。”但也有人认为,只盯前沿榜单会误读谷歌策略。用户bysse判断谷歌最终可能“胜出”,理由是拥有全球基础设施,且Gemini具备多模态能力、价格较低、用途不限于编码。willitexplode则指出,谷歌面向普通用户需要的是“快速、准确的智能”,未必需要把最强模型都作为公开产品提供。
还有网友将讨论拉回演示效果。Hans-Wermhatt对员工入职指导演示中语音助手主动描述用户当前页面的行为感到不满:“我知道自己在哪一页。除非我提问,或者我有视觉障碍,否则你不用告诉我正在看什么。”这指出了实时视觉助手的一个体验问题:模型能看见画面只是起点,还需判断何时该说、何时该保持安静。
整体来看,谷歌对语音Agent的判断是:自然对话是入口,真正困难的是在对话不断线的情况下理解现场、调用外部系统并完成任务。Extended Thinking将推理与执行搬到后台,让用户听到进度;其实际价值,仍取决于开发者能否把这种能力接入可靠的业务流程。语音模型的竞争,正从“说得像人”转向“做事像人”。