R2T2 网易有道开源的低延迟真流式语音识别模型
R2T2是什么
R2T2是网易有道开源的低延迟真流式语音识别模型,全称Real Real-Time Transcription,基于Qwen3-ASR构建。R2T2采用append-only机制,已上屏文本不回改,支持80ms—2s可调分块、中英优化与热词上下文,平均延迟约200—600ms,提供vLLM、Transformers、llama.cpp/GGUF等后端,适合实时字幕、语音Agent和同传前端。

R2T2的主要功能
真流式识别 :按 80ms–2s 可调 chunk 持续进音频、持续出文字。
落子无悔 :已提交文本不回改,避免字幕闪烁和 Agent 动作被改写。
低延迟高准确 :官方口径平均延迟约 200–600ms,流式精度接近离线识别。
热词/上下文 :支持提示词、领域词、专名等先验,提高生僻词命中率。
多语言 :优化中英,同时保留法德意日韩俄西阿等跨语言能力。
多后端部署 :支持 vLLM、Transformers、llama.cpp/GGUF,并可起 WebSocket 服务。
R2T2的技术原理
模型底座 :R2T2 基于 Qwen3-ASR,继承其音频编码与序列建模能力,针对流式输出做约束训练。
稳定前缀学习 :训练时用 stable-prefix、强制时间对齐、token 级音频切分等数据构造,让模型学会判断“哪些前缀已经足够稳定可以外发”。
Commit/Wait 解码 :每来一小段音频,模型先评估当前稳定前缀;够稳就 commit 成不可改文本,不够稳就 wait 继续缓存更多上下文。
上下文条件生成 :只把稳定前缀作为后续预测条件,既给足语义约束,又保证历史输出不被后续音频翻盘。
延迟—精度调节 :通过 chunk 大小、尾部长度/回退窗口等参数控制吞吐、延迟与容错,小 chunk 更快但更冒险,大 chunk 更稳但更慢。
如何使用R2T2
克隆仓库 : git clone https://github.com/netease-youdao/Confucius4-R2T2.git 。
建隔离环境 :用 Conda 或 uv 创建 Python 3.12 环境并 pip install -e . ,或直接用官方 qwenllm/qwen3-asr Docker。
下载权重 :按后端选择 HF/ModelScope 的 Confucius4-R2T2 或 Confucius4-R2T2-GGUF 。
先跑离线/流式示例: ./run_example.sh audio.wav --model_path ... --infer_mode stream_vllm --language Chinese --chunk_size_ms 160 。
写流式代码 :加载 R2T2ASRModel.LLM , init_streaming_state() 后按 16kHz chunk 循环调 streaming_transcribe() ,最后 finish_streaming_transcribe() 。
要 CPU/llama.cpp 部署 :用 r2t2_llama 的 stream_llama_hybrid 或 stream_llama/onetime_llama 模式。
起实时服务 :用 ./run_start_server.sh start --model_path ... --vad_model_path checkpoints/vad/Stream-VAD --port 8272 --gpu 0 。
接客户端 :向 ws://localhost:8272/asr_stream_api_v1 发送 16kHz mono int16 PCM,结束发送 YOUDAO_ONETIME_ASR_STREAM_EOS 。
调体验参数 :用 language 、 chunk_size_ms 、 context/hotword 、 unfixed_token_num 在延迟、准确率和术语命中间取舍。
R2T2的核心优势
真流式且不回改 :已输出文本像“落子无悔”,避免字幕闪烁和 Agent 误执行。
低延迟 :官方口径平均约 200–600ms,适合实时字幕、同传和语音 Agent。
延迟/精度可调 :支持 80ms–2s 分块,按场景在更快与更稳之间切换。
离线能力不弱 :加流式约束不明显牺牲离线识别精度,可一套模型兼顾两类任务。
底座与生态强 :基于 Qwen3-ASR,开源后快速出现 GGUF、llama.cpp、Core ML、离线工具适配。
工程化友好 :提供 vLLM、Transformers、llama.cpp 后端和 WebSocket 服务,便于接入生产。
可控输入先验 :支持上下文/热词提示,提升人名、产品名、术语识别率。
多语言覆盖 :优化中英,同时保留多种跨语言流式识别能力。
R2T2的项目官网
项目官网 :https://r2t2.ai/
GitHub仓库 :https://github.com/netease-youdao/Confucius4-R2T2
HuggingFace模型库 :https://huggingface.co/netease-youdao/Confucius4-R2T2
R2T2的同类竞品对比
维度 | R2T2 | GPT-Realtime-Whisper
维度 | R2T2 | GPT-Realtime-Whisper |
|---|---|---|
产品性质 | 有道开源真流式 ASR,可私有化/二次开发 | OpenAI 托管流式 STT API,走 Realtime/ transcription session 体系 |
核心卖点 | append-only“落子无悔”,已出文本不回改 | 边说边出字,强调低延迟转写和 API 集成 |
延迟口径 | 官方称平均约 200–600ms,80ms–2s chunk 可调 | 第三方实测约 TTFS p50 556ms、TTFT p50 1838ms;口径与 R2T2 不完全可比 |
精度参考 | README 给中英文多测试集流式/离线结果,需按业务复现 | 第三方样本均值 WER 5.1%,但分布长尾明显,也要按语种复现 |
可控性 | 代码 Apache-2.0、权重另有协议;支持热词/上下文/WebSocket | 闭源 API;可控点主要在 session 配置、音频参数与后处理 |
生态部署 | vLLM/HF/llama.cpp/GGUF/WebSocket,社区量化与离线工具多 | 与 OpenAI Realtime 生态、transcription session、云方言集成更顺 |
R2T2的应用场景
实时会议字幕 :边发言边出定稿字幕,减少字幕回改造成的阅读干扰。
Voice Agent 指令入口 :把“转账三百改三千”这类改口语句稳定识别,降低 Agent 误执行风险。
车载/智能硬件语音交互 :在低延迟约束下输出不可撤回的指令文本,适合导航、电话、车控场景。
呼叫中心实时辅助 :边说边转写并推送给坐席提示,兼顾延迟、术语热词与私有化合规。
课堂/无障碍听写 :为听力受损者或笔记场景提供稳定逐字流,减少闪烁和事后修订成本。