跳到主内容
multimodalGoogle DeepMind

Gemini 3.8 Live

Google DeepMind 于 2026-09-15 发布的原生语音到语音(speech-to-speech)实时对话模型,含标准版与 Extended Thinking 两个版本。Extended Thinking 可在说话的同时后台推理、异步调用工具并实时汇报进度,以 82.6 分登顶 Artificial Analysis 语音质量指数;实测每小时输入音频成本 3.50 美元,标准版低至 0.84 美元。支持 97 种语言单次对话内切换、近实时视觉输入、128K 上下文,输出音频带 SynthID 水印。

发布 2026-09-17更新 2026-09-24核实 2026-09-17

规格

厂商
Google DeepMind
发布日期
2026/9/15
类型
multimodal
上下文窗口
131K tokens
最大输出
66K tokens
定价
音频输入 $3.00/百万 token($0.005/分钟)·音频输出 $12.00/百万 token($0.018/分钟)·文本输入 $0.75/百万·文本输出 $4.50/百万·图像视频输入 $1.00/百万
API 兼容
Gemini API, Google AI Studio

基准测试

82.6(Extended Thinking,榜首)
Artificial Analysis Speech to Speech Quality Index
98%
Big Bench Audio(语音推理)
68.6%
τ-Voice(客服任务完成率)
35.1%
τ³-Banking(银行场景,Sierra)
91.9%
Full Duplex Bench(打断与停顿)
1.35 秒
首次出声延迟
标准版 $0.84 / Extended Thinking $3.50
每小时输入音频实测成本
标准版 1083 / Extended Thinking(High)990
Speech Agent Arena(盲测 Elo)

优势

  • •原生端到端语音到语音,跳过转写与合成环节,目标端到端延迟 200ms 以内并保留完整声学上下文(语调、重音、迟疑)
  • •Extended Thinking 可边推理边说话,工具调用在后台异步执行,用「让我查一下」这类自然回应填充等待,消除对话空白
  • •Artificial Analysis 语音质量指数 82.6 分,为该榜最高分;Big Bench Audio 98%、τ-Voice 68.6% 均领先 GPT-Live-1
  • •成本优势显著:标准版实测每小时输入音频 0.84 美元,为该榜最低;Extended Thinking 3.50 美元仍比 GPT-Live-1 的 5.83 美元低四成
  • •97 种语言自动检测并在单次对话内中途切换,适合混合语种地区的客服与支持热线
  • •所有输出音频带 SynthID 水印,便于内容溯源与合规
  • •发布当天即有 LangChain、LiveKit、Pipecat、Agora、Vercel 原生集成,可复用现有编排层

不足

  • •Live API 会话有硬时钟:纯音频 15 分钟、音频加视频 2 分钟,长对话必须自建续接逻辑
  • •Extended Thinking 仅支持异步非阻塞函数调用,同步阻塞模式不可用,老代码需改造
  • •turnComplete: true 的语义改变——后台推理时也会返回该标志,把它当「活干完了」会造成任务提前判定完成
  • •Proactive audio 常开且不可关闭,模型会主动忽略「不是说给它听」的内容,某些场景需要额外适配
  • •标准版盲测语音竞技场 1083 Elo,低于上一代 Gemini 3.1 Flash Live 的 1096;Extended Thinking(High)990 Elo、任务成功率 89.1%,低于标准版的 93.2%
  • •Full Duplex Bench(打断与停顿)91.9%,落后 GPT-Live-1 的 94.9%——真实客服里能否被自然打断,体感权重可能高于综合跑分
  • •知识截止 2025 年 1 月;模型卡自陈仍有幻觉、越狱防护待完善、偶发变慢或超时
  • •扩展思考会生成推理 token 并按输出费率计费,同一张价目表下实测账单约为标准版的四倍

适用场景

呼叫中心与客服语音 Agent(成本敏感、需要可靠打断与多语种)需要边查边答的多步语音助手:查订单、查库存、办理退款、预约改签实时语音教学与陪练(Extended Thinking 可边讲解边推理)常监听场景的主动式助手(Proactive audio 可抑制非目标语音的响应)视障辅助与实时视觉解说(近实时视觉输入 + 语音输出)替代 STT + LLM + TTS 三级级联管线,降低延迟与运维复杂度

定位一句话

Google DeepMind 于 2026-09-15 发布的原生语音到语音实时对话模型系列,含 Gemini 3.8 Live(低延迟、成本优先)与 Gemini 3.8 Live Extended Thinking(复杂任务、边想边说)两个版本,模型 ID 分别为 gemini-3.8-live 与 gemini-3.8-live-extended-thinking。

它的核心主张不是「语音版的大模型」,而是用单个端到端模型取代 STT + LLM + TTS 的三级级联管线,并把「推理」与「说话」从串行改成并行。

两个版本怎么选

维度Gemini 3.8 LiveGemini 3.8 Live Extended Thinking
定位规模化、成本效率、流畅对话、视觉 grounding复杂多步任务、推理与说话并行
工具调用同步 / 异步均可仅异步非阻塞
推理深度无 thinking_levelthinking_level:low / medium / high
主动音频可选常开,不可关闭
每小时成本(实测)$0.84$3.50
质量指数—82.6(榜首)

选型规则:答案质量比首个字速度更重要时用 Extended Thinking;高并发、成本敏感、任务简单时用标准版。

定价

项目价格折算
音频输入$3.00 / 百万 token$0.005 / 分钟
音频输出$12.00 / 百万 token$0.018 / 分钟
文本输入$0.75 / 百万 token—
文本输出$4.50 / 百万 token—
图像 / 视频输入$1.00 / 百万 token$0.002 / 分钟
免费额度Google AI Studio 免费档输入输出均免费

两版标价完全相同,但 Extended Thinking 生成推理 token 并按输出费率计费。同一套任务下实测账单约为标准版的四倍——做预算请按推理 token 算,不要按标价算。

技术规格

  • 上下文窗口:128K token(131,072)输入 / 64K token(65,536)输出
  • 模态:文本、图像、音频、视频
  • 语言:97 种,单次对话内自动检测并中途切换
  • 会话限制:纯音频 15 分钟,音频加视频 2 分钟
  • 音频格式:有状态 WebSocket,输入 16-bit PCM @16kHz,输出 24kHz
  • 水印:全部输出音频带 SynthID
  • 底座:基于 Gemini 3 Pro(模型卡标注),非 Flash 系列
  • 知识截止:2025 年 1 月
  • 企业版:Gemini Enterprise 私测中

适合 / 不适合

适合

  • 呼叫中心与客服语音 Agent,尤其是多语种地区
  • 需要边查边答、工具调用链路较长的语音助手
  • 正在维护三级级联管线、想降低延迟与运维复杂度的团队
  • 成本敏感但需要接近前沿质量的语音产品

不适合

  • 需要超过 15 分钟连续会话且不愿自建续接的场景
  • 依赖同步阻塞函数调用的既有架构
  • 对「能否被自然打断」要求极高的场景(Full Duplex Bench 落后 GPT-Live-1)
  • 需要最新知识的问答(知识截止 2025 年 1 月)

相关阅读

来源

待核实:全部基准分数来自 Artificial Analysis 第三方评测,其中 GPT-Live-1 对照组仅单次试验;每小时成本为该机构按固定任务集实测值,非 Google 官方口径。Gemini Enterprise 版本处于私测。本卡由 AI 之家 编辑部基于公开资料整理,非厂商付费内容。

避坑清单

  1. 先算每分钟成本,再看 token 单价:语音模型的计费单位是音频时长(本卡音频输入 $0.005/分钟、输出 $0.018/分钟)。一个不打断的长会议,成本可能比同内容文本高两个数量级。
  2. 打断处理是体验分水岭:真实对话里用户会抢话。上线前必须实测 barge-in(打断)延迟,否则「智能」会被「迟钝」抵消。
  3. 第三方基准不等于你的场景:本卡基准全部来自 Artificial Analysis,且 GPT-Live-1 对照组仅单次试验(见文末声明)。用自己的音频样本(口音、噪声、专业术语)复测。
  4. 131K 上下文是够用不是万能:长会话仍会累积噪声,建议配周期性摘要(参见 Context Engineering)。
  5. 国内合规路径要提前定:语音数据涉及个人信息与可能的出境问题,录音留存与存储位置必须在设计阶段确定。

FAQ

Q: 什么场景值得上实时语音模型? A: 三类:用户不方便打字(车载、家务、工业现场)、语音本身就是产品形态(客服、陪练、语言学习)、对话节奏要求自然(需要打断、重叠、语气反馈)。纯信息查询类场景打字更快更省,别为了「炫」上语音。

Q: 延迟多少才算可用? A: 行业经验值:端到端 800ms 以内对话才自然,超过 1.2s 用户会明显感到「在等机器」。但实际延迟受你的网络链路与部署区域影响极大,务必在你自己的目标区域压测。

Q: 和「文本模型 + TTS + ASR」拼装方案比呢? A: 拼装方案胜在可控与便宜,原生语音模型胜在打断、语气、重叠对话这些交互细节。如果需求只是「读出答案」,拼装更划算;如果需求是「像人一样对话」,才值得上原生。