R2T2是什么
R2T2是网易有道开源的低延迟真流式语音识别模型,全称Real Real-Time Transcription,基于Qwen3-ASR构建。R2T2采用append-only机制,已上屏文本不回改,支持80ms—2s可调分块、中英优化与热词上下文,平均延迟约200—600ms,提供vLLM、Transformers、llama.cpp/GGUF等后端,适合实时字幕、语音Agent和同传前端。

R2T2的主要功能
- 真流式识别:按 80ms–2s 可调 chunk 持续进音频、持续出文字。
- 落子无悔:已提交文本不回改,避免字幕闪烁和 Agent 动作被改写。
- 低延迟高准确:官方口径平均延迟约 200–600ms,流式精度接近离线识别。
- 热词/上下文:支持提示词、领域词、专名等先验,提高生僻词命中率。
- 多语言:优化中英,同时保留法德意日韩俄西阿等跨语言能力。
- 多后端部署:支持 vLLM、Transformers、llama.cpp/GGUF,并可起 WebSocket 服务。
R2T2的技术原理
- 模型底座:R2T2 基于 Qwen3-ASR,继承其音频编码与序列建模能力,针对流式输出做约束训练。
- 稳定前缀学习:训练时用 stable-prefix、强制时间对齐、token 级音频切分等数据构造,让模型学会判断“哪些前缀已经足够稳定可以外发”。
- Commit/Wait 解码:每来一小段音频,模型先评估当前稳定前缀;够稳就 commit 成不可改文本,不够稳就 wait 继续缓存更多上下文。
- 上下文条件生成:只把稳定前缀作为后续预测条件,既给足语义约束,又保证历史输出不被后续音频翻盘。
- 延迟—精度调节:通过 chunk 大小、尾部长度/回退窗口等参数控制吞吐、延迟与容错,小 chunk 更快但更冒险,大 chunk 更稳但更慢。
微信关注回复“开源”,加入AI开源项目交流群
如何使用R2T2
- 克隆仓库:git clone https://github.com/netease-youdao/Confucius4-R2T2.git。
- 建隔离环境:用 Conda 或 uv 创建 Python 3.12 环境并 pip install -e .,或直接用官方 qwenllm/qwen3-asr Docker。
- 下载权重:按后端选择 HF/ModelScope 的 Confucius4-R2T2 或 Confucius4-R2T2-GGUF。
- 先跑离线/流式示例:./run_example.sh audio.wav --model_path ... --infer_mode stream_vllm --language Chinese --chunk_size_ms 160。
- 写流式代码:加载 R2T2ASRModel.LLM,init_streaming_state() 后按 16kHz chunk 循环调 streaming_transcribe(),最后 finish_streaming_transcribe()。
- 要 CPU/llama.cpp 部署:用 r2t2_llama 的 stream_llama_hybrid 或 stream_llama/onetime_llama 模式。
- 起实时服务:用 ./run_start_server.sh start --model_path ... --vad_model_path checkpoints/vad/Stream-VAD --port 8272 --gpu 0。
- 接客户端:向 ws://localhost:8272/asr_stream_api_v1 发送 16kHz mono int16 PCM,结束发送 YOUDAO_ONETIME_ASR_STREAM_EOS。
- 调体验参数:用 language、chunk_size_ms、context/hotword、unfixed_token_num 在延迟、准确率和术语命中间取舍。
R2T2的核心优势
- 真流式且不回改:已输出文本像“落子无悔”,避免字幕闪烁和 Agent 误执行。
- 低延迟:官方口径平均约 200–600ms,适合实时字幕、同传和语音 Agent。
- 延迟/精度可调:支持 80ms–2s 分块,按场景在更快与更稳之间切换。
- 离线能力不弱:加流式约束不明显牺牲离线识别精度,可一套模型兼顾两类任务。
- 底座与生态强:基于 Qwen3-ASR,开源后快速出现 GGUF、llama.cpp、Core ML、离线工具适配。
- 工程化友好:提供 vLLM、Transformers、llama.cpp 后端和 WebSocket 服务,便于接入生产。
- 可控输入先验:支持上下文/热词提示,提升人名、产品名、术语识别率。
- 多语言覆盖:优化中英,同时保留多种跨语言流式识别能力。
R2T2的项目官网
- 项目官网:https://r2t2.ai/
- GitHub仓库:https://github.com/netease-youdao/Confucius4-R2T2
- HuggingFace模型库:https://huggingface.co/netease-youdao/Confucius4-R2T2
R2T2的同类竞品对比
维度R2T2GPT-Realtime-Whisper产品性质有道开源真流式 ASR,可私有化/二次开发OpenAI 托管流式 STT API,走 Realtime/ transcription session 体系核心卖点append-only“落子无悔”,已出文本不回改边说边出字,强调低延迟转写和 API 集成延迟口径官方称平均约 200–600ms,80ms–2s chunk 可调第三方实测约 TTFS p50 556ms、TTFT p50 1838ms;口径与 R2T2 不完全可比精度参考README 给中英文多测试集流式/离线结果,需按业务复现第三方样本均值 WER 5.1%,但分布长尾明显,也要按语种复现可控性代码 Apache-2.0、权重另有协议;支持热词/上下文/WebSocket闭源 API;可控点主要在 session 配置、音频参数与后处理生态部署vLLM/HF/llama.cpp/GGUF/WebSocket,社区量化与离线工具多与 OpenAI Realtime 生态、transcription session、云方言集成更顺
R2T2的应用场景
- 实时会议字幕:边发言边出定稿字幕,减少字幕回改造成的阅读干扰。
- Voice Agent 指令入口:把“转账三百改三千”这类改口语句稳定识别,降低 Agent 误执行风险。
- 车载/智能硬件语音交互:在低延迟约束下输出不可撤回的指令文本,适合导航、电话、车控场景。
- 呼叫中心实时辅助:边说边转写并推送给坐席提示,兼顾延迟、术语热词与私有化合规。
- 课堂/无障碍听写:为听力受损者或笔记场景提供稳定逐字流,减少闪烁和事后修订成本。