Google 在 Gemini API 与 AI Studio 中发布了新的实时语音模型,扩展了构建语音优先产品的工具链。Gemini 3.8 Live 是原生语音到语音模型的一次明显跃升,能在维持对话的同时执行任务;需要复杂推理时可切换 3.8 Live Extended Thinking,它在语音到语音评测榜上排名第一。配套的 3.5 Transcribe 是专用语音转文字模型,覆盖 85 种以上语言,流式平均词错率 4.0%、非流式 2.6%。
🔑 核心要点
Gemini 3.8 Live 带来原生语音到语音的跃升,能在维持对话的同时执行任务。
3.8 Live Extended Thinking 面向复杂请求提供更深推理,在语音到语音评测榜上排名第一。
新模型支持异步函数调用:工具调用在后台执行,音频回复继续向用户流式输出。
对话可被实时视觉输入锚定,而不只依赖语音。
3.5 Transcribe 覆盖 85 种以上语言,流式词错率 4.0%、非流式 2.6%。
💡 金句
Gemini 3.8 Live 为我们的原生语音到语音模型带来了一次台阶式跃升,它能在保持对话的同时执行任务。