首页/ 资讯/ MAI-Transcribe-2-Streaming 微软推出的语音转写模型

MAI-Transcribe-2-Streaming 微软推出的语音转写模型

灵犀编辑部 2026-10-07 2 阅读

MAI-Transcribe-2-Streaming是什么

MAI-Transcribe-2-Streaming 是微软推出的首个实时流式语音转写模型,能在讲话进行时持续输出文字,覆盖 60 种语言并自动检测语言切换,首批文本延迟低至数百毫秒,文字最快在语音后 320 毫秒显示。MAI-Transcribe-2-Streaming 在 Artificial Analysis 流式转写榜用 2.50% 词错误率、0.13 秒延迟双双登顶,适合实时字幕、客服智能体等边听边理解的场景。

MAI-Transcribe-2-Streaming

MAI-Transcribe-2-Streaming的主要功能

  • 实时流式转写 :讲话进行时持续输出文字,无需等待语句结束。
  • 60 种语言覆盖 :单一模型支持 60 种语言的语音识别。
  • 自动语言检测 :无需预设语言,可在会话中自动识别并跟随语言切换。
  • 超低延迟输出 :首批文本在收到音频后低数百毫秒内生成,文字最快在语音后 320 毫秒显示。
  • 高精度转写 :Artificial Analysis 流式榜最终词错误率 2.50%,最终与部分转录准确率均排名第一。

MAI-Transcribe-2-Streaming的技术原理

  • 增量式流式处理架构 :模型用音频流小块为单位边接收边处理,从架构层面消除传统批式转写必须说完再出结果的等待,使延迟从秒级压缩到百毫秒级,为实时对话场景奠定基础。
  • 部分假设与稳定提交的两阶段输出机制 :模型在收到音频后先快速生成部分假设,即初步文字结果;用不断到达的后续上下文对假设持续修正,待语句结束后提交一份稳定的最终转录。这一机制在快与准之间取得平衡:应用可立即基于 partials 启动理解。
  • 多语言统一建模与连续语言检测 :60 种语言由单一模型承载,无需在会话前指定语言;模型依据语音内容本身判断语种,能在说话者切换语言时连续跟随。避免多模型路由的开销和语种切换时的中断问题。
  • 面向 Agent 工作流的边听边理解设计 :应用可在语句尚未说完时即基于 partials 推断用户意图,提前启动推理或调用工具,把转写、理解、执行三个环节从串行改为并行,显著缩短语音 Agent 的端到端响应时间。

如何使用MAI-Transcribe-2-Streaming

  • 注册 Azure 账号 :创建 Microsoft Foundry 项目并获取 API 密钥与终结点。
  • 选择接入方式 :通过 Azure Speech SDK/REST API 流式接口调用,或在 OpenRouter、Vercel、LiveKit 上直接调用模型 API。
  • 建立流式音频通道 :将麦克风或实时音频流以小块(chunk)形式持续推送给模型,而非上传完整录音文件。
  • 接收并处理部分结果 :监听模型返回的 partial 文本(低数百毫秒内到达),用于实时展示字幕或提前触发意图理解。
  • 提交稳定转写结果 :在语句结束时获取模型 commit 的最终转录文本,用于落库、记录或后续处理。
  • 处理多语言场景 :无需预设语种,由模型自动检测说话语言并在切换时连续跟随。

MAI-Transcribe-2-Streaming的核心优势

  • 行业第一精度 :2.50% 词错误率登顶 Artificial Analysis 流式转写榜(共 28 个模型),部分与最终转录准确率双料第一。
  • 极低转写延迟 :最终转录延迟仅 0.13 秒,文字最快在语音后 320 毫秒显示,最接近的竞争对手需 500 毫秒以上。
  • 边说边理解的实时架构 :流式输出 partial 结果,应用无需等用户说完即可启动推理和工具调用,缩短语音 Agent 端到端响应。
  • 60 语种开箱即用 :单一模型覆盖 60 种语言,自动连续检测语种并跟随切换,免除多模型路由和手动配置的麻烦。
  • 灵活的部署选择 :支持 Microsoft Foundry、Azure Speech 直接 API,以及 OpenRouter、Vercel、LiveKit 等多个第三方平台接入。

MAI-Transcribe-2-Streaming的同类竞品对比

>
对比维度 MAI-Transcribe-2-Streaming Qwen-Audio-3.0-ASR-Flash
模型范式 流式(边说边出字,partials → 稳定结果) 非实时(短音频一次性识别,≤5 分钟)
转写精度 2.50% 词错误率(Artificial Analysis 流式榜第 1,第三方实测) 中文工业场景错字率 7.8%、英文 11.52%(厂商自测口径,与 WER 不可直接横比)
延迟表现 最终转录 0.13 秒;文字最快语音后 320 毫秒显示 非流式范式,无实时延迟指标,走完整音频处理后返回
语言覆盖 60 种,自动检测并跟随切换 30+ 种,含中文七大方言、20+ 种口音
垂直定制 未提供 热词定制(即时+预编译)、行业词库、上下文增强、语音润色
定价 $0.54/小时(优惠价,至 2026 年底,原价未公布) 约 $0.126/小时($0.000035/秒,长期定价)
生态接入 Foundry / Azure Speech / OpenRouter / Vercel / LiveKit 阿里云百炼 / DashScope

MAI-Transcribe-2-Streaming的应用场景

  • 实时字幕与无障碍服务 :直播、视频会议、课堂中文字随声出,320 毫秒级显示速度接近所说即所见,听障人士体验大幅提升。
  • 客服中心智能体 :来电者话未说完时系统已开始识别问题、检索信息,缩短平均处理时长,高峰期并发接待能力提升。
  • 语音助手与 AI Agent :基于高准确率的 partial 结果提前启动推理和工具调用,把听-想-做从串行变并行,对话不再有尴尬停顿。
  • 多语言会议实时翻译 :60 语种自动检测与切换,跨国会议中发言人换语言无需手动重设,可作为同传系统的识别前端。
  • 医疗与法律实时文书 :门诊问诊、庭审记录中边说边出稿,医生/律师结束后即刻获得完整转写稿,显著减少文书工作时间。
相关工具
与本文相关的 AI 工具
AI 智能推荐 ×
输入关键词,AI 从 1000+ 工具中精准匹配推荐