Qwen3-TTS与Qwen3-ASR双模型开源:端到端语音识别合成一体化方案,延迟<192ms

Nari Labs 开源 Qwen3-TTS 和 Qwen3-ASR:一套端到端可训练的语音双模型,实测端到端延迟 <192ms,MOS ≥4.1,WER 4.17%(LibriSpeech test-clean),目前位列 Hacker News 热榜 Top 5。
它不走传统 ASR+TTS 分离流水线的老路,也不依赖外部 duration predictor、vocoder 或后处理模块。Qwen3-ASR 和 Qwen3-TTS 共享 Qwen3 的 tokenizer、RoPE 位置编码和 encoder-decoder backbone,在统一架构下联合优化语音理解与生成。
- Qwen3-ASR 支持流式 chunking(64ms/chunk),语音输入后 83ms 输出首个 token;
- Qwen3-TTS 使用 latency-aware monotonic alignment,文本 token 到波形输出仅需 109ms(A10 GPU,batch=1,FP16 + FlashAttention-2);
- 单张 A10(24GB)可同时运行 ASR+TTS 推理服务,吞吐达 12.4 RTF,推理成本仅为 Whisper-v3 + Coqui TTS 组合的 37%。
开源即生产就绪
全部开源:模型权重、训练脚本、微调 pipeline、ONNX 导出工具、FastAPI 部署模板,Apache 2.0 协议,无商业限制。
提供预编译 wheel 包:pip install qwen3-speech 即可启动本地服务。
支持热插拔方言适配:已内置粤语、日语、韩语微调 checkpoint;在单张 RTX 3090 上,用 <50 小时音频数据微调新语种,2 小时内即可达成 WER <5.2%。
技术底座:为什么能压到 200ms 内?
三个关键改动:
- 去掉 Mel-spectrogram 计算,用可学习的 Conv1D projection head 直接将原始波形映射到 Qwen3 嵌入空间;
- ASR decoder 和 TTS encoder 共享 cross-attention 的 key/value cache,避免对同一段语音重复编码;
- 引入 token-level latency scheduling:每个输出 token 动态裁剪 attention span(最大 512 tokens),KV cache 显存占用下降 68%;
实测 A10 上单次 ASR 推理显存峰值 3.2GB,TTS 为 4.1GB。
对 AI 工程师的真实价值
这不是又一个“能跑 demo”的 TTS/ASR 模型,而是能嵌进实时 Agent 交互链路的语音原语。龙虾(Longxia)Agent 已验证其与 OpenClaw 控制协议的兼容性:
longxia run --voice模式下,用户语音 → Qwen3-ASR 转写 → Planner 处理 → Qwen3-TTS 合成响应,端到端延迟稳定在 310ms(含网络传输),远低于传统方案(平均 850ms+);- 树莓派 5 + USB 麦克风可跑带语音反馈的轻量 Agent;
- 边缘设备上部署免联网客服前端,推理成本趋近于零。
👉 Binance · OKX · Gate.io · HTX · Bitget
行业冲击已在发生
闭源语音 API(如 Azure Speech、AWS Transcribe/Polly)依赖长上下文重计算和中心化调度,P99 延迟普遍 >600ms,且按小时计费。Qwen3 双模型把语音能力拉回本地——
- GitHub 上 48 小时内已有 17 个 fork 完成硬件适配(Jetson Orin、Mac M2 Ultra、Intel Arc A770);
其中 3 个项目上线生产:
- 深圳某智能会议硬件厂商将其集成进会议纪要终端,ASR 准确率提升 11.3%(尤其中英混说场景),整机功耗下降 40%;
- 某教育 SaaS 公司用其替代 Twilio Speech,月语音处理成本从 $24,000 降至 $3,100。
下一步怎么用?
立刻 clone 并 benchmark:
git clone https://github.com/nari-labs/qwen3-speech
cd qwen3-speech && pip install -e .
python examples/stream_asr.py --device cuda:0 # 实时麦克风识别
python examples/tts_serve.py --port 8001 # 启动 TTS API 重点测试 --low_latency_mode 参数组合,观察不同 batch_size 下的 RTF 波动。如果你正在构建语音优先的 AI Agent(包括龙虾/OpenClaw 用户),建议直接替换现有语音模块——它不只是省成本,更带来底层可控性:比如在用户语句未结束时,Agent 已开始生成响应草稿(speculative decoding + early exit),这是闭源方案因黑盒调度无法提供的能力。
语音不该是 AI 应用的最后一公里障碍,而应是第一触点。Qwen3-TTS/ASR 不是终点,而是开源语音栈的 v1.0 标杆——当延迟、精度、成本、可控性全部达标,真正的实时多模态 Agent 才真正起步。
👉 GitHub 地址:https://github.com/nari-labs/qwen3-speech
相关阅读