谷歌Gemini 3.8 Live发布:边聊边执行任务,强化复杂推理
谷歌推出全新实时音频模型Gemini 3.8 Live,支持97种语言,允许用户在对话中同步执行后台任务,并新增Extended Thinking模式以应对复杂推理场景,进一步提升了语音交互的连续性与实用性。
实时交互再进化:Gemini 3.8 Live 发布
谷歌近日推出新一代实时音频模型 Gemini 3.8 Live,官方将其定位为目前最先进的实时音频交互模型。该模型的核心突破在于改变了传统语音助手“一问一答”的交互方式:用户无需等待当前任务执行完毕,即可继续与模型对话,被托付的任务会在后台持续运行。这意味着在查询天气、设定提醒或处理多步骤请求时,对话流不会中断,交互体验更接近人与人之间的自然交流。
与早期实时音频模型相比,Gemini 3.8 Live 在语言覆盖面上也显著扩展,支持多达 97 种语言。这一特性使其能够服务于更广泛的全球用户群体,尤其有利于多语言环境下的实时翻译、跨语言客服以及教育场景。谷歌方面表示,该模型在语音识别、语义理解和响应生成等环节均进行了优化,以降低对话延迟并提升多轮交流的连贯性。
边聊边办事:任务后台运行与实时视觉上下文
Gemini 3.8 Live 的另一项重要能力是支持实时视觉上下文。用户可以通过声音提问,同时让模型理解当前摄像头或屏幕中的画面内容。例如,在视频通话、在线学习或远程协作过程中,用户可以直接就画面中的对象、文字或场景发问,模型会结合视觉信息给出回应。这种多模态交互方式减少了手动输入的需求,使语音成为更高效的操控入口。
此外,该模型允许任务在后台异步执行。用户可以在对话中随时插入新问题,而不必等待前一个任务完成。这种“边聊边办事”的模式,对于需要调用外部工具、查询数据或执行多步操作的场景尤为实用。谷歌强调,模型在后台运行任务时仍能保持对话的上下文关联,避免因任务切换导致信息丢失。
- 多语言支持:覆盖 97 种语言,适应全球化应用需求。
- 后台任务:对话不中断,任务在后台持续运行。
- 实时视觉:结合声音与画面内容进行多模态交互。
- 扩展思考:Extended Thinking 模式针对复杂推理任务。
Extended Thinking 与复杂推理场景
谷歌同时为 Gemini 3.8 Live 引入了 Extended Thinking 模式,主打复杂推理能力。该模式允许模型在回答前进行更深入的思考步骤,适用于数学求解、逻辑分析、代码调试等需要多步推导的任务。与常规实时对话不同,Extended Thinking 会在后台消耗更多计算资源,以换取更高的答案准确性和推理深度。用户可以根据任务类型在实时交互与深度推理之间切换,兼顾效率与质量。
从行业角度看,实时音频模型正成为各大科技公司竞逐的焦点。谷歌、微软、亚马逊 AWS 等厂商均在推动语音助手向更自然、更智能的方向演进。Gemini 3.8 Live 的发布,进一步模糊了语音助手与智能代理之间的界限:它不再只是被动应答,而是能够主动执行任务、理解视觉环境并处理复杂推理。对于开发者和企业而言,这类模型有望在客服、教育、无障碍辅助、远程协作等领域催生新的应用形态。
目前,谷歌尚未公布 Gemini 3.8 Live 的具体开放时间与接入方式,但可以预见,随着实时音频与多模态能力的持续融合,人机交互将朝着更少等待、更多并行的方向演进。后续值得关注的是该模型在真实网络环境下的延迟表现、多语言识别的准确率,以及 Extended Thinking 模式对计算成本的影响。