Google Gemini 3.8 Live 上线:实时语音模型正式进入「边聊边办」时代
9 月 15 日,Google 正式发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时语音模型,并面向 Gemini API 与 Google AI Studio 全面开放。
事件内容
两款模型均为端到端音频到音频模型,支持音频、图像、视频、文本多模态输入,输出音频与文本,拥有 128K 上下文窗口和 64K 输出上限。核心差异在于定位:
- Gemini 3.8 Live:主打低延迟、低成本,适合高并发客服、前台对话等场景。第三方实测每小时输入音频成本约 0.84 美元。
- Gemini 3.8 Live Extended Thinking:在说话的同时进行多步推理和异步工具调用,可边处理任务边用语音提示进度,适合复杂语音代理。在 Artificial Analysis 语音到语音质量指数中以 82.6 分位列第一,但成本约为标准版的 4 倍。
其他关键能力包括:
- 对话中自动检测并切换 97 种语言;
- 异步函数调用,工具执行不阻塞对话流;
- 音频输出带 SynthID 水印;
- 基于 Gemini 3 Pro 构建,而非 Flash 模型。
值得关注的原因
- 语音 Agent 的经济性拐点:Gemini 3.8 Live 将语音代理成本压到每小时不足 1 美元,呼叫中心和消费级语音产品的规模化部署门槛大幅降低。
- 「边说边办」成为可选项:Extended Thinking 把推理和说话解耦,让语音 Agent 不再需要在「反应快」和「能深想」之间二选一,为复杂多步任务打开了语音交互入口。
- 与 OpenAI GPT-Live-1 正面竞争:两款模型都在同一周发布,Google 在价格上更具侵略性,并在第三方语音质量指数上略胜一筹,语音模型市场的双头格局加速形成。
来源
- Google DeepMind 官方博客
- DataNorth AI:《Google launches Gemini 3.8 Live and Extended Thinking》
- AI/TLDR:《Gemini 3.8 Live — Google's Real-Time Audio Model》

评论(0)
暂无评论,来抢沙发~
请 登录 后发表评论