谷歌近日宣布推出两款新型人工智能模型——Gemini3.8Live及其进阶版本Extended Thinking,标志着实时语音交互技术迈入全新阶段。这两款模型不仅支持近实时推理能力,还能在语音对话过程中同步处理后台工具调用与API请求,用户无需中断交流即可完成网络搜索或复杂任务执行。
核心功能方面,模型实现了97种语言的自动检测与无缝切换,即使在对话中途更换语言也能保持流畅交互。其视觉定位功能可实现近乎实时的图像识别响应,而针对需要深度思考的任务,系统会通过"让我核实一下..."等自然语言提示主动反馈进度,避免用户产生等待焦虑。特别值得关注的是,Extended Thinking版本在持续对话场景中展现出更强的上下文理解能力,能够维持长达数分钟的复杂逻辑推理。
性能评估数据显示,Extended Thinking在Artificial Analysis的语音质量指数中取得82.6分,在T-Voice测试中达到68.6%的准确率,Big Bench Audio测试更以97.7%的得分展现其音频处理优势。基础版本Gemini3.8Live则在Speech Agent Arena评测中位居次席,在Sierra T-Voice基准测试中获得35.1%的成绩。这些数据表明新模型在语音交互的自然度与任务处理效率上均有显著提升。
技术部署层面,两款模型已通过Gemini API和Google AI Studio向开发者开放,并深度整合至Search Live、Gemini Enterprise等核心产品矩阵。谷歌与Agora、LiveKit等六家技术平台建立合作,提供便捷的集成方案,开发者可快速将新功能嵌入现有应用。为保障内容安全,所有生成的音频均嵌入不可见的SynthID数字水印,确保AI创作内容的可追溯性。
此次升级重新定义了语音交互的边界,将传统"听-说"模式升级为包含理解、推理、执行的多维度智能交互。用户现在可以通过自然对话完成机票预订、数据分析等复杂操作,而系统在后台自动调用相关服务的能力,使语音助手真正具备代理人的功能属性。这项突破为智能客服、教育辅导、远程协作等领域带来新的发展可能。






