Gemini 3.8 Live 谷歌推出的原生实时语音对话模型
Gemini 3.8 Live是什么
Gemini 3.8 Live 是谷歌推出的实时语音对话模型系列,包括Gemini 3.8 Live 面向规模化部署,兼顾对话智能、视觉理解与成本效益;Gemini 3.8 Live Extended Thinking 强化多步推理,可边推理边语音播报进度。模型全系采用原生语音对语音架构,支持 97 种语言自动切换与后台异步工具调用,登顶 Artificial Analysis 语音质量指数,生成音频带 SynthID 水印,已面向开发者、企业和普通用户推送。

Gemini 3.8 Live的主要功能
- 实时语音对话 :以原生语音对语音方式对话,响应接近实时,在 Speech Agent Arena 用户偏好度排名第二。
- 异步工具调用 :在后台执行 API 和工具调用,同时持续向用户播报语音回复,不打断对话。
- 视觉理解 :近实时处理摄像头画面,为对话提供视觉上下文。
- 多语言切换 :支持 97 种语言,对话中自动检测并无缝切换语种。
- 字母数字高精度 :准确解析确认码、理赔号等技术性字符串数据。
- 增量内容更新 :将实时音频与结构化数据无缝融合,返回上下文感知的响应。
Gemini 3.8 Live的技术原理
- 端到端语音对语音架构 :模型摒弃了语音识别→文本大模型→语音合成的传统级联管道,直接用音频到音频的方式处理输入输出,显著降低延迟并保留语调、语速等声学细节,是此前 Gemini 3.1 Flash Live 架构路线的延续升级。
- 并行推理与边想边说 :Extended Thinking 变体采用异步推理机制,在后台进行多步思考的同时继续流式输出语音,通过让我确认一下…这类早期口头提示先确认请求,再实时播报任务进度,实现推理与发言并行而不冻结对话。
- 可配置思考预算 :Extended Thinking 支持开发者按需配置思考强度档位,在复杂任务上投入更多后台推理算力,在简单对话中压低延迟与成本,官方定价为音频输入 0.005 美元/分钟、输出 0.018 美元/分钟。
- 全链路内容水印 :所有生成音频嵌入 SynthID 隐形水印,直接织入音频信号本身,即使经过剪辑或压缩仍可被检测,用于防范语音伪造与虚假信息传播。
如何使用Gemini 3.8 Live
Gemini 3.8 Live:
Gemini 3.8 Live Extended Thinking:
Gemini 3.8 Live的核心优势
- 端到端语音架构 :原生语音对语音处理,相比级联方案延迟更低、更保留语调等声学细节。
- 成本效益突出 :音频输入 0.005 美元/分钟、输出 0.018 美元/分钟,适合大规模部署。
- 异步工具调用 :后台执行 API 和函数调用,同时持续语音回复,多步任务不打断对话。
- 视觉实时理解 :可近实时处理摄像头画面,实现能听会看的语音智能体。
- 97 种语言自动切换 :对话中自动检测并无缝切换语种,覆盖全球用户。
- 并行推理能力 :Extended Thinking 变体边推理边说,以让我确认一下…等口头提示保持对话流畅。
- 基准领先 :Extended Thinking 登顶 Artificial Analysis 语音质量指数(82.6),Big Bench Audio 得分 97.7%。
Gemini 3.8 Live的同类竞品对比
对比项 | Gemini 3.8 Live | OpenAI gpt-realtime-2.1
| 对比项 | Gemini 3.8 Live | OpenAI gpt-realtime-2.1 |
|---|---|---|
| 模型架构 | 原生语音对语音,级联方案的精简替代 | 原生语音对语音,GPT-5 级推理内置音频循环 |
| 定价模式 | 按分钟计费 | 按 token 计费 |
| 音频输入成本 | 0.005 美元/分钟 | 32 美元/百万 token(约 0.019 美元/分钟) |
| 音频输出成本 | 0.018 美元/分钟 | 64 美元/百万 token(约 0.077 美元/分钟) |
| 典型会话成本 | 约 0.005–0.018 美元/分钟 | 实际约 0.06–0.11 美元/分钟,长对话无缓存可达 0.18–0.46 美元/分钟 |
| 语言支持 | 97 种语言,对话中自动检测切换 | 实时语音翻译需单独模型,支持 70+ 输入语言至 13 种输出语言 |
| 视觉理解 | 支持,近实时处理摄像头画面(最高约 1 帧/秒) | 未提供同等的实时视觉语音对话能力 |
| 深度推理 | Extended Thinking 变体边推理边发言,支持思考档位配置 | 内置推理循环,但无”边想边说”进度播报机制 |
| 基准成绩 | AA 语音质量指数第一(82.6),Big Bench Audio 97.7% | Big Bench Audio 较前代提升 15.2% |
| 内容安全 | 全量生成音频嵌入 SynthID 隐形水印 | 无等效音频水印机制 |
Gemini 3.8 Live的应用场景
- 员工入职指导 :通过摄像头实时视觉理解,新员工可边操作边语音提问,AI 即时解答流程问题。
- 智能客服与银行业务 :结合异步函数调用完成多步骤业务办理,在后台处理时实时播报进度,对应 τ-Voice-banking 基准测试场景。
- 出行与预订助手 :用户语音提出多条件需求后,AI 在后台异步调用订票、酒店 API,边查询边保持自然对话不中断。
- 编程与设计协作 :开发者对着草图语音描述需求,Extended Thinking 边推理边生成可用的 React 组件代码。
- 实时故障排查 :用户在 Search Live 中语音描述问题,AI 结合视觉画面逐步语音指导排查与修复。
相关工具
与本文相关的 AI 工具