Muse Voice Transcribe Meta 推出的首个实时音频感知模型
Muse Voice Transcribe是什么
Muse Voice Transcribe 是 Meta 推出的首个实时音频感知模型,集流式自动语音识别、说话人分割与端点检测于一体。模型支持 70 多种语言及原生语码切换,可处理超 1 小时长音频与 20 人以上同时对话,在流式转写和语音分割基准测试中均排名第一。Muse Voice Transcribe 基于强化学习的自适应延迟技术,能动态权衡速度与准确率。Muse Voice Transcribe 已集成至 Meta AI 与 Muse Code,定位为 AI 系统的实时感知层。

Muse Voice Transcribe的主要功能
- 实时流式 ASR :模型以 80ms 为单位实时处理音频并输出文字,无需等待整段音频结束。
- 说话人分割 :自动识别并标记超过 20 位不同说话人,区分谁在何时发言。
- 语音端点检测 :精准判断语音开始与结束时刻,支持自然停顿与连续对话。
- 多语言与语码切换 :覆盖 70 多种语言,原生支持中英文夹杂等任意语码转换。
- 长音频与多人会议 :可连续处理超过 1 小时音频,无需后处理即可输出完整转写。
Muse Voice Transcribe的技术原理
自回归多模态架构 :基于 Muse Spark 系列的自回归模型,将音频流逐帧转化为软 token 并与文本 token 统一建模,实现音频到文本的端到端生成。
流式音频 token 机制 :每 80ms 音频片段编码为软 token,模型通过预测 |next_audio| 决定是否继续监听下一段,收到 |empty_audio| 则立即输出剩余文本,实现真正的流式推理。 任务扩展特殊 token :在 ASR 基础上引入 |start_of_turn| 与 |speaker_{A-Z}| 实现说话人切换识别,引入 |speech_onset| 与 |speech_endpoint| 实现端点检测,所有任务共享同一流式训练框架。 强化学习自适应延迟 :通过 RL 将词错误率奖励与延迟奖励以乘法方式组合,使模型根据每个单词的识别难度动态决定等待更多上下文还是立即输出,在速度与准确率间达到帕累托最优。
如何使用Muse Voice Transcribe
- 选择入口 :通过 Meta Model API、Mac 版 Meta AI 或 Muse Code 三种方式接入服务。
- 启动语音 :在 Muse Code 中按下 ⌘ + v 快捷键,或在 Mac 版 Meta AI 中点击语音按钮开始听写。
- 跨应用使用 :在任意 Mac 应用中按住 Fn 键,即可调用 Meta AI 完成语音转写。
- API 调用 :通过 Meta Model API 按量计费(每 1000 分钟 3 美元),集成到自己的应用或工作流中。
Muse Voice Transcribe的核心优势
- 实时流式 ASR :用 80ms 为单位处理音频,实现真正的低延迟实时转写。
- 多人说话人分割 :原生支持超过 20 位说话人区分,无需后处理即可精准归属每句话。
- 自适应延迟 :通过强化学习动态调整每个单词的等待时间,在速度与准确率之间达到帕累托最优。
- 无缝语码切换 :原生支持句子内或句子间的任意语言切换,精准识别中英文夹杂等混合表达。
- 超长音频处理 :支持超过 1 小时的连续长音频输入,适用于长时间会议或访谈场景。
- 语音端点检测 :自动标记语音开始( |speech_onset| )与结束( |speech_endpoint| ),精准判断用户何时说完。
- 基准测试第一 :在 Artificial Analysis 流式语音转文本和公开语音分割基准测试中均排名第一。
Muse Voice Transcribe的项目地址
- 项目官网 :https://research.meta.ai/blog/introducing-muse-voice-transcribe
Muse Voice Transcribe的同类竞品对比
| 对比维度 | Muse Voice Transcribe (Meta) | Gemini 3.1 Flash Live (Google) |
|---|---|---|
| 产品定位 | 专门的实时音频感知与 ASR 模型 | 通用实时多模态对话模型,ASR 只是其输入能力之一 |
| 核心能力 | 流式 ASR、说话人分割、语音端点检测 | 实时双向语音对话(ASR + TTS)、多模态(音频/视频/图像/文本)、函数调用 |
| 词错误率 | AA-WER Streaming Index 3.1%,Artificial Analysis 排名第一 | 未公布具体 ASR WER 数值,主打低延迟流式 ASR 与对话流畅度 |
| 说话人分割 | 原生支持 20+ 位说话人,DER 仅 17.5% | 未明确支持多人说话人分割,专注单轮/双轮实时对话 |
| 延迟策略 | 自适应延迟,通过强化学习为每个单词动态调整等待时间 | Sub-200ms 固定首 token 延迟,追求极速响应 |
| 长音频处理 | 原生支持 1 小时+ 连续音频,无需分段 | 纯音频会话默认 15 分钟限制,需接入 session 续接机制 |
| 语码切换 | 原生支持句子内/间任意语码转换,精准识别中英文夹杂 | 支持 90+ 种语言,但未强调语码切换专项优化 |
| 纯转写成本 | $0.18/小时 | 音频输入 $0.30/小时 + 文本输出约 $0.07/小时,合计约 $0.37/小时 |
| 输出能力 | 仅文本转写 + 说话人标签(<|speaker_A|>) |
文本 + 音频合成(TTS)+ 工具调用 + 结构化输出 + 实时搜索 |
Muse Voice Transcribe的应用场景
- 跨国会议实时纪要 :支持20+人同时发言、超过1小时的长时间会议,自动区分说话人并精准转写中英文夹杂的讨论内容。
- AI语音助手/Agent :作为实时感知层,提供低延迟流式ASR与精准的语音端点检测,让AI助手知道用户何时开始和结束说话。
- 播客与访谈字幕生成 :处理长达数小时的音频素材,原生支持多人对话分割,无需后期手动标注说话人。
- 多语言客服质检 :实时转写客服与客户的混合语言对话,用上下文偏好提升专业术语识别准确率,并自动归档。
- 开发者语音输入工具 :通过Mac版Meta AI或Muse Code的Fn键全局调用,在任何应用中实现语音转写编程、写文档或发消息。
相关工具
与本文相关的 AI 工具