首页/ 资讯/ Gemini 3.8 Live 谷歌推出的原生实时语音对话模型

Gemini 3.8 Live 谷歌推出的原生实时语音对话模型

灵犀编辑部 2026-09-16 0 阅读

Gemini 3.8 Live是什么

Gemini 3.8 Live 是谷歌推出的实时语音对话模型系列,包括Gemini 3.8 Live 面向规模化部署,兼顾对话智能、视觉理解与成本效益;Gemini 3.8 Live Extended Thinking 强化多步推理,可边推理边语音播报进度。模型全系采用原生语音对语音架构,支持 97 种语言自动切换与后台异步工具调用,登顶 Artificial Analysis 语音质量指数,生成音频带 SynthID 水印,已面向开发者、企业和普通用户推送。

Gemini 3.8 Live

Gemini 3.8 Live的主要功能

  • 实时语音对话 :以原生语音对语音方式对话,响应接近实时,在 Speech Agent Arena 用户偏好度排名第二。
  • 异步工具调用 :在后台执行 API 和工具调用,同时持续向用户播报语音回复,不打断对话。
  • 视觉理解 :近实时处理摄像头画面,为对话提供视觉上下文。
  • 多语言切换 :支持 97 种语言,对话中自动检测并无缝切换语种。
  • 字母数字高精度 :准确解析确认码、理赔号等技术性字符串数据。
  • 增量内容更新 :将实时音频与结构化数据无缝融合,返回上下文感知的响应。

Gemini 3.8 Live的技术原理

  • 端到端语音对语音架构 :模型摒弃了语音识别→文本大模型→语音合成的传统级联管道,直接用音频到音频的方式处理输入输出,显著降低延迟并保留语调、语速等声学细节,是此前 Gemini 3.1 Flash Live 架构路线的延续升级。
  • 并行推理与边想边说 :Extended Thinking 变体采用异步推理机制,在后台进行多步思考的同时继续流式输出语音,通过让我确认一下…这类早期口头提示先确认请求,再实时播报任务进度,实现推理与发言并行而不冻结对话。
  • 可配置思考预算 :Extended Thinking 支持开发者按需配置思考强度档位,在复杂任务上投入更多后台推理算力,在简单对话中压低延迟与成本,官方定价为音频输入 0.005 美元/分钟、输出 0.018 美元/分钟。
  • 全链路内容水印 :所有生成音频嵌入 SynthID 隐形水印,直接织入音频信号本身,即使经过剪辑或压缩仍可被检测,用于防范语音伪造与虚假信息传播。

如何使用Gemini 3.8 Live

Gemini 3.8 Live:

  • 开发者 :可在 Gemini API 和 Google AI Studio 中使用。
  • 企业用户 :Gemini Enterprise 私有预览中开放。
  • 所有用户 :可在 Search Live 中体验。

Gemini 3.8 Live Extended Thinking:

  • 开发者 :可在 Gemini API 和 Google AI Studio 中使用。
  • 企业用户 :Gemini Enterprise 私有预览中开放,即将登陆 Gemini Enterprise for Customer Experience 及 Google Workspace 企业客户。
  • 所有用户 :可在 Gemini Live 中体验;Google AI Pro 和 Ultra 订阅者可在 Workspace 的 Docs 中使用,所有 Google AI 订阅者可在 Gmail 和 Keep 中体验。

Gemini 3.8 Live的核心优势

  • 端到端语音架构 :原生语音对语音处理,相比级联方案延迟更低、更保留语调等声学细节。
  • 成本效益突出 :音频输入 0.005 美元/分钟、输出 0.018 美元/分钟,适合大规模部署。
  • 异步工具调用 :后台执行 API 和函数调用,同时持续语音回复,多步任务不打断对话。
  • 视觉实时理解 :可近实时处理摄像头画面,实现能听会看的语音智能体。
  • 97 种语言自动切换 :对话中自动检测并无缝切换语种,覆盖全球用户。
  • 并行推理能力 :Extended Thinking 变体边推理边说,以让我确认一下…等口头提示保持对话流畅。
  • 基准领先 :Extended Thinking 登顶 Artificial Analysis 语音质量指数(82.6),Big Bench Audio 得分 97.7%。

Gemini 3.8 Live的同类竞品对比

对比项 | Gemini 3.8 Live | OpenAI gpt-realtime-2.1

>
对比项 Gemini 3.8 Live OpenAI gpt-realtime-2.1
模型架构 原生语音对语音,级联方案的精简替代 原生语音对语音,GPT-5 级推理内置音频循环
定价模式 按分钟计费 按 token 计费
音频输入成本 0.005 美元/分钟 32 美元/百万 token(约 0.019 美元/分钟)
音频输出成本 0.018 美元/分钟 64 美元/百万 token(约 0.077 美元/分钟)
典型会话成本 约 0.005–0.018 美元/分钟 实际约 0.06–0.11 美元/分钟,长对话无缓存可达 0.18–0.46 美元/分钟
语言支持 97 种语言,对话中自动检测切换 实时语音翻译需单独模型,支持 70+ 输入语言至 13 种输出语言
视觉理解 支持,近实时处理摄像头画面(最高约 1 帧/秒) 未提供同等的实时视觉语音对话能力
深度推理 Extended Thinking 变体边推理边发言,支持思考档位配置 内置推理循环,但无”边想边说”进度播报机制
基准成绩 AA 语音质量指数第一(82.6),Big Bench Audio 97.7% Big Bench Audio 较前代提升 15.2%
内容安全 全量生成音频嵌入 SynthID 隐形水印 无等效音频水印机制

Gemini 3.8 Live的应用场景

  • 员工入职指导 :通过摄像头实时视觉理解,新员工可边操作边语音提问,AI 即时解答流程问题。
  • 智能客服与银行业务 :结合异步函数调用完成多步骤业务办理,在后台处理时实时播报进度,对应 τ-Voice-banking 基准测试场景。
  • 出行与预订助手 :用户语音提出多条件需求后,AI 在后台异步调用订票、酒店 API,边查询边保持自然对话不中断。
  • 编程与设计协作 :开发者对着草图语音描述需求,Extended Thinking 边推理边生成可用的 React 组件代码。
  • 实时故障排查 :用户在 Search Live 中语音描述问题,AI 结合视觉画面逐步语音指导排查与修复。
相关工具
与本文相关的 AI 工具
AI 智能推荐 ×
输入关键词,AI 从 1000+ 工具中精准匹配推荐