当地时间 2026 年 9 月 15 日,Google 正式发布两款新一代实时语音对话模型——Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。Google 称这是其迄今最先进的实时对话模型,在智能和并行推理方面实现了重大升级。两款模型均为原生语音到语音(Speech-to-Speech)模型,跳过了传统 ASR → LLM → TTS 的串联架构,直接在音频层面完成理解与生成。
模型地址:Gemini官网 (海外网站需要科学上网)

一、产品定位:一条产品线,两种使命
Google 对这两款模型的定位异常清晰:
- Gemini 3.8 Live:为规模化与成本效率而生,结合对话智能、流畅交流与视觉理解能力,适合大规模部署。
- Gemini 3.8 Live Extended Thinking:为高复杂度任务而生,具备更强的智能和多步推理能力。
这不是简单的“大小杯”关系,而是一次产品线的根本性分叉。正如 OrcaRouter 的评测所指出的,两者的区别在于对“语音代理的职责”有着不同的理解——“一个是对话界面,另一个是碰巧会说话的推理系统”。
二、核心突破:“边说边想”如何工作?
传统语音 AI 的根本矛盾
在以往的主流语音交互架构中,AI 系统面临一个两难困境:要么快速响应但只能进行浅层对话,要么进行深度思考但需要用户忍受长时间的静默等待。用户提出问题后,面对复杂任务往往只能听着“正在思考”的提示音干等,体验割裂且不自然。
Gemini 3.8 Live Extended Thinking 的解法
Gemini 3.8 Live Extended Thinking 赋予了 AI “边说边想”(Think as it speaks)的后台扩展推理能力:系统在维持实时连贯对话的同时,于后台并发执行复杂的多步骤逻辑拆解、代码排错或技术诊断。
具体而言,该模型在推理的同时同步进行语音输出,通过“让我确认一下……”(Let me check that…)这类早期语言提示自然回应提示,同时以实时进度叙述引导用户了解多步后台任务的执行进展。这意味着用户不再需要在复杂问题面前等待沉默——模型会一边处理任务,一边用自然语言告知进展,保持对话的连贯性。
Google 首席工程师 Tom Ouyang 在官方博客中表示,这些模型为开发者和企业提供了构建可靠、可投入生产的语音智能体的基础模块。
三、基准测试:多项评测登顶
根据 Google 公布的测试数据:
| 基准测试 | Gemini 3.8 Live Extended Thinking | 说明 |
|---|---|---|
| Artificial Analysis Speech-to-Speech Quality Index | 82.6(总排名第一) | 超越 OpenAI GPT-Live-1 Astra(81.5%)和 SpaceXAI Grok Voice Think Fast 2.0(81.3%) |
| Big Bench Audio(推理能力) | 97.7% | 语音推理能力评测 |
| τ-Voice(智能体任务完成) | 68.6% | 多步骤任务完成率 |
| Sierra τ-Voice-banking | 35.1% | 银行业务场景语音任务 |
Gemini 3.8 Live 标准版在 Artificial Analysis 语音到语音指数中得分 76.0,在 Speech Agent Arena 中排名第二。在 ServiceNow 的 EVA-Bench 语音智能体基准测试中,两款模型均推高了复杂工作流的帕累托前沿,成功平衡了准确性与对话质量。
需要指出的是,以上数据均由 Google 自行报告,目前尚无独立实验室的复现结果。
四、关键能力对比
| 能力维度 | Gemini 3.8 Live | Gemini 3.8 Live Extended Thinking |
|---|---|---|
| 核心定位 | 规模部署与成本效率 | 高复杂度任务与多步推理 |
| 推理模式 | 快速响应式对话 | 边说边想,推理与发言同步 |
| 视觉输入 | 近实时处理 | 近实时处理 |
| 多语言 | 97 种语言,对话中自动切换 | 97 种语言,对话中自动切换 |
| 后台工具调用 | 支持,对话不中断 | 支持,附带实时进度叙述 |
| Artificial Analysis 指数 | 76.0 | 82.6 |
| 音频定价 | $0.005/分钟(输入),$0.018/分钟(输出) | 与 3.8 Live 一致 |
两款模型共享多项底层能力:均可近实时处理视觉输入,在对话中自动检测并切换 97 种支持的语言,并在后台执行工具与 API 调用而保持对话流畅不中断。所有 AI 生成的音频均嵌入了 Google 的 SynthID 隐形水印,用于检测 AI 生成内容。
五、定价:按分钟计费的音频API
Gemini 3.8 Live 系列通过 Live API 提供服务,音频输入定价为 $0.005/分钟,音频输出为 $0.018/分钟,双向语音对话综合成本约为 $1.38/小时。文本输入为 $0.75/百万 Token,输出为 $4.50/百万 Token。
根据 Artificial Analysis 的独立估算,Extended Thinking 版本运行一小时输入音频的成本约为 $3.50,标准版约为 $0.84——“每小时的差距超过四倍,换来的是 6.6 分的指数差异”。这构成了开发者选型的核心决策点。
六、开发者接入与生态
开发者可通过 Gemini Live API 接入两款模型,模型 ID 分别为 gemini-3.8-live 和 gemini-3.8-live-extended-thinking。Google 已与多家开发者平台建立集成,包括 Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents 等。此外,Google 还与 Salesforce、Genspark、Lumeris 等企业合作推进生态建设。
七、产品落地:从 Search 到 Workspace
两款模型的推送渠道有所侧重:
- Gemini 3.8 Live 已开始推送:开发者可在 Gemini API 和 Google AI Studio 使用;企业用户可在 Gemini Enterprise 抢先体验;全用户可在 Search Live 体验。
- Gemini 3.8 Live Extended Thinking 也已开启推送:开发者渠道同上;企业用户可在 Gemini Enterprise 抢先体验,即将登陆 Google Workspace;普通用户可在 Gemini Live 体验,Google AI Pro 和 Ultra 订阅者可在 Docs 使用,所有 Google AI 订阅者可在 Gmail 和 Keep 体验。
这一推送策略与 Google 近期在产品线中的整体布局一致——Gmail Live、Docs Live、Keep Live 等对话式功能均基于 Extended Thinking 模型构建。
八、行业意义:语音 AI 从“能对话”走向“能办事”
Gemini 3.8 Live 系列的发布,标志着语音 AI 正在跨越一个关键门槛。在此之前,语音助手在复杂任务面前几乎必然陷入“沉默—等待—输出”的回合制模式,用户体验与文字交互存在本质差距。Gemini 3.8 Live Extended Thinking 的“边说边想”机制,将深度推理从“对话的敌人”变成了“对话的一部分”——模型不再是先想完再说,而是边说边想,用语言本身承载推理过程。
对于智能客服、实时编程辅助、同声传译、远程技术诊断等场景而言,这意味着语音代理第一次具备了与人类专家“边聊边解决问题”相当的能力。Google 将这一进展定位为“语音智能体从可用走向可生产”的关键一步。
当然,基准测试的厂商自报性质、Extended Thinking 版本四倍于标准版的运行成本,以及实际生产环境中推理延迟对对话自然度的影响,仍是需要持续观察的变量。
更多信息请参阅
Live API 文档:ai.google.dev/gemini-api/docs/live-api
AITOP100-AI资讯频道将持续关注AI行业新闻资讯消息,带来最新AI内容讯息。
想了解AITOP100平台其它版块的内容,请点击下方超链接查看
AI创作大赛 | AI活动 | AI工具集 | AI资讯专区 | AI小说
AITOP100平台官方交流社群二维码:











