首页/ 资讯/ Gemini 3.5 Transcribe 谷歌推出的最新语音转文本模型

Gemini 3.5 Transcribe 谷歌推出的最新语音转文本模型

灵犀编辑部 2026-08-27 1 阅读

Gemini 3.5 Transcribe是什么

Gemini 3.5 Transcribe 是 Google 推出的最新语音转文本模型,支持实时流式和预录音频处理两种模式,前者通过 Live API 实现亚秒级延迟,后者支持说话人归属与词级时间戳。Gemini 3.5 Transcribe 能自动清理填充词与自我纠正、识别 85 种以上语言及实时语言切换、自定义专业词汇,词错误率低至 2.6%,支持调用其他 Gemini 模型完成图像生成等复杂任务。

<a class=Gemini 3.5 Transcribe" contenteditable="false">

Gemini 3.5 Transcribe的主要功能

  • 实时流式转录 :通过 Live API 提供亚秒级延迟的连续双向语音转文本服务。

  • 预录音频转写 :通过 Interactions API 为录音文件提供带说话人归属和词级时间戳的精确转录。

  • 智能文本清理 :自动去除嗯啊等填充词,修正自我纠正语句,并输出格式化文本。

  • 自定义词汇适配 :根据用户提供的专业术语和特殊拼写调整转录结果,准确识别邮政编码、订单号等字母数字组合。

  • 多语言自动检测 :支持 85 种以上语言的自动识别与转录,并能处理实时语言切换和多种口音方言。

  • 多说话人区分 :在预录音频中准确归属最多三位说话人的发言内容。

  • 跨模型功能调用 :在转录过程中可调用其他 Gemini 模型执行图像生成、文件分析等复杂任务。

  • 屏幕上下文融合 :结合设备屏幕内容和对话历史提升特定场景下的转录准确度。

Gemini 3.5 Transcribe的技术原理

  • 端到端音频理解 :模型直接从原始音频波形生成文本,避免中间表示引入的误差累积,同时保留语音中的语调、停顿等副语言信息用于语义消歧。

  • 原生多模态融合 :基于 Gemini 3.5 统一架构,音频与文本在共享的 Transformer 注意力空间中进行联合编码,使模型能建立声学特征与语义概念的直接映射。

  • 上下文感知推理 :通过长上下文窗口同时处理语音信号、屏幕截图文本和对话历史,用交叉注意力机制动态加权相关上下文,提升专有名词、文件名称和领域术语的识别精度。

  • 增量流式解码 :采用自适应分块与投机解码策略,在音频输入持续到达的同时进行局部语义整合,平衡低延迟需求与输出稳定性,支持双向交互中的即时响应与打断处理。

如何使用Gemini 3.5 Transcribe

开发者接入 :通过 Gemini API 在 Google AI Studio 或 Gemini Enterprise Agent Platform 调用模型。

实时语音交互 :用 Live API 调用 gemini-3.5-transcribe-live 实现双向流式转录。 录音文件处理 :用 Interactions API 调用 gemini-3.5-transcribe 进行带时间戳的离线转写。 macOS 桌面端 :在 Gemini macOS 应用中直接用语音输入、编辑文本并调用其他模型功能。 Android 输入法 :在 Gboard 中开启 Rambler 功能,语音输入自动清理并支持语音改稿。 Chrome 浏览器 :即将支持在任意网页输入框中语音输入与打字。 企业部署 :通过 Gemini Enterprise Agent Platform 集成至客服与内部工作流。 第三方框架 :借助 Agora、LiveKit、Vercel 等已接入 Live API 的平台快速搭建语音应用。

Gemini 3.5 Transcribe的核心优势

  • 转录精度领先 :流式场景词错误率低至 4.0%,非流式低至 2.6%,在嘈杂环境中仍能准确捕获字母数字实体。

  • 延迟大幅优化 :相比前代 Chirp 3,最终转录交付时间缩短 70%,实时流式响应达到亚秒级。

  • 智能语义清理 :自动去除填充词、修正自我纠正语句,并输出可直接使用的格式化文本。

  • 多语言无缝切换 :自动识别并转录 85 种以上语言,支持对话中的实时语言切换与多方言口音适配。

  • 说话人精准归属 :预录音频支持最多三位说话人的发言区分,并附带词级时间戳便于回溯定位。

  • 屏幕上下文感知 :结合设备屏幕内容与对话历史,显著提升文件名称、专业术语和活跃文档的识别准确度。

  • 跨模型任务协同 :内置 Function Calling 能力,可在转录过程中调用其他 Gemini 模型完成图像生成、文件分析等复杂操作。

Gemini 3.5 Transcribe的项目地址

  • 项目官网 :https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/

Gemini 3.5 Transcribe的同类竞品对比

对比维度 | Gemini 3.5 Transcribe | OpenAI GPT-4o-transcribe


对比维度

Gemini 3.5 Transcribe

OpenAI GPT-4o-transcribe

定位

智能语音转录模型,支持实时流式与预录音频

GPT-4o 架构的专用转录模型,API 托管服务

词错误率 WER

流式 4.0% / 非流式 2.6%

约 2.5%(干净音频,行业领先)

实时流式延迟

亚秒级,原生双向连续流式

支持流式,通过 Realtime API 实现

智能文本清理

自动去除填充词、修正自我纠正、格式化输出

不支持,输出原始口语化文本

说话人归属

原生支持最多 3 人区分 + 词级时间戳

不支持原生,需额外调用 diarize 端点

Gemini 3.5 Transcribe的应用场景

  • 实时会议智能纪要 :在多人会议中实时流式转录,自动区分说话人、清理口语填充词,调用 Gemini 模型即时生成会议摘要与待办事项。

  • 多语言客服语音助手 :通过 Live API 构建亚秒级延迟的语音客服系统,自动识别客户语言并实时切换,结合自定义词汇准确识别订单号、产品型号等关键信息。

  • 医疗与法律口述记录 :医生或律师通过语音口述病历、庭审记录,模型自动清理自我纠正语句并格式化专业术语,输出可直接归档的标准文档。

  • 跨语言实时字幕与翻译 :为直播、视频会议提供多语言实时字幕,用 85+ 语言自动检测能力,结合实时语言切换实现无缝跨语言沟通。

  • 语音驱动编程与办公自动化 :在 Google AI Studio 或 Gemini macOS 应用中,开发者通过语音描述需求即可生成代码,办公人员语音指令调用屏幕上下文完成跨应用文件总结与图像生成。

相关工具
与本文相关的 AI 工具
AI 智能推荐 ×
输入关键词,AI 从 1000+ 工具中精准匹配推荐