Google Gemini 3.8 Live 上线:实时语音模型正式进入「边聊边办」时代

Google Gemini 3.8 Live 上线:实时语音模型正式进入「边聊边办」时代

Author: tengdy | Create: 2026-09-16 22:42:57 | Update: 2026-09-16 22:42:57 | 分类:大模型

Gemini语音模型LiveGoogle

Google Gemini 3.8 Live 上线:实时语音模型正式进入「边聊边办」时代

9 月 15 日,Google 正式发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时语音模型,并面向 Gemini API 与 Google AI Studio 全面开放。

事件内容

两款模型均为端到端音频到音频模型,支持音频、图像、视频、文本多模态输入,输出音频与文本,拥有 128K 上下文窗口和 64K 输出上限。核心差异在于定位:

  • Gemini 3.8 Live:主打低延迟、低成本,适合高并发客服、前台对话等场景。第三方实测每小时输入音频成本约 0.84 美元。
  • Gemini 3.8 Live Extended Thinking:在说话的同时进行多步推理和异步工具调用,可边处理任务边用语音提示进度,适合复杂语音代理。在 Artificial Analysis 语音到语音质量指数中以 82.6 分位列第一,但成本约为标准版的 4 倍。

其他关键能力包括:

  • 对话中自动检测并切换 97 种语言;
  • 异步函数调用,工具执行不阻塞对话流;
  • 音频输出带 SynthID 水印;
  • 基于 Gemini 3 Pro 构建,而非 Flash 模型。

值得关注的原因

  1. 语音 Agent 的经济性拐点:Gemini 3.8 Live 将语音代理成本压到每小时不足 1 美元,呼叫中心和消费级语音产品的规模化部署门槛大幅降低。
  2. 「边说边办」成为可选项:Extended Thinking 把推理和说话解耦,让语音 Agent 不再需要在「反应快」和「能深想」之间二选一,为复杂多步任务打开了语音交互入口。
  3. 与 OpenAI GPT-Live-1 正面竞争:两款模型都在同一周发布,Google 在价格上更具侵略性,并在第三方语音质量指数上略胜一筹,语音模型市场的双头格局加速形成。

来源

  • Google DeepMind 官方博客
  • DataNorth AI:《Google launches Gemini 3.8 Live and Extended Thinking》
  • AI/TLDR:《Gemini 3.8 Live — Google's Real-Time Audio Model》

评论(0)

暂无评论,来抢沙发~


关于本站 · RSS

浙ICP备2025156991号浙公网安备33010802013816号 浙公网安备33010802013816号 © 2026 智能体工场 - [从善如登] All rights reserved.