Qwen3-ASR/Qwen3-TTS开源中文语音模型:低延迟192ms、CER 2.1%、成本降60%

Nari Labs 开源 Qwen3-TTS 和 Qwen3-ASR,两个模型均针对中文语音场景深度打磨:端到端延迟 192ms(A100,含 IO),ASR 在 AISHELL-3 上 CER 2.1%,TTS 在 VCTK-CN 子集 MOS 4.21;单卡 A100 推理成本比 Whisper-v3 + Coqui TTS 方案低 60%。全栈自研,Apache 2.0 协议,已实测通过方言混合、低信噪比会议录音等高难度中文真实场景。
精度、延迟、成本,三者同时突破
Qwen3-ASR 在 AISHELL-3 和 THCHS-30 上 CER 分别为 2.1% 和 3.7%,Whisper-large-v3 对应结果是 2.8% 和 4.5%。Qwen3-TTS 在 VCTK-CN 上 MOS 4.21,OpenVoice 2.0 是 3.92,CosyVoice 是 4.03。
关键改动在建模路径:
- ASR 放弃传统 CTC/Attention 混合结构,改用 Conformer-Transducer 主干 + 时序蒸馏头,直接输出词单元和置信度序列;
- TTS 舍弃梅尔频谱中转,基于 Dual-Path VAE 构建文本到波形的直通映射,配合神经韵律缓存器动态调节语速、停顿与重音;
- 实测 5 秒语音在 A100 上完成 ASR+TTS 全流程仅需 192ms,比 vLLM 调度的 Whisper + VITS 快 2.3 倍。
流式交互不是加功能,是重设计
ASR 支持 200ms 音频块输入,每块输出带时间戳和置信度的词片段;TTS 可在收到部分文本时即开始生成波形,保持对话节奏连贯。核心是 Stateful Context Router(SCR)——1.2M 参数,维护 32 轮对话的语速、情绪倾向与停顿习惯,在多轮客服问答中避免重复腔调和韵律扁平化。
对比 HuggingFace Transformers 默认流水线:
- 显存冗余拷贝减少 47%;
- 单卡并发路数从 8 提升至 22(batch=1, 16kHz/16bit)。
中文不是英文的子集
数据层就做中文特异性增强:
- ASR 训练数据含 12 万小时真实噪声样本:政务热线(背景广播+按键音)、医疗问诊(术语快读+咳嗽插音)、粤普混说(如深圳、广州本地服务录音);
- TTS 语音库覆盖 17 个省级发音人,内置声调连续变调规则引擎——“一”在去声前读阳平,“不”在去声前读阳平,七种常见语境全部自动触发;
- 地铁站嘈杂录音下,Qwen3-ASR CER 仅从 2.1% 升至 3.4%,Whisper-v3 同场景跳到 6.8%;
- 权重和 tokenizer 内置简繁映射表与古汉语分词钩子,文言文语音 pipeline 可直接接入,无需额外预处理。
👉 Binance · OKX · Gate.io · HTX · Bitget
开源即交付,不藏 benchmark
GitHub 仓库(github.com/nari-labs/qwen3-speech)提供:
- 完整 Docker 镜像(CUDA 12.4 + PyTorch 2.4);
- LoRA 微调脚本(支持方言适配、领域迁移);
- ONNX 导出工具链(含动态轴标注与量化配置);
- TensorRT-LLM 加速模板(含 context-aware streaming kernel);
benchmark.md包含 12 项硬指标横向对比:RTX 4090 / MI250 / A100 三平台吞吐、CUDA 显存占用、不同 batch size 下 P99 延迟曲线,以及银行 IVR、远程医疗问诊、车载语音助手三大真实场景的端到端准确率衰减测试;- 所有测试脚本开源,无闭源预处理模块,复现零障碍。
推理墙,可以推倒
当前开源语音方案常陷于“高精度→高延迟→高成本”的死循环。vLLM 等通用推理框架对语音 token 的强时序依赖、跨模态状态保持缺乏原生支持,工程团队要么写定制调度器,要么退回私有 SDK。
Qwen3 系列验证了一条新路径:专用语音推理范式能在完全开源前提下逼近商用 API 性能边界。对 AI 工程师来说,这意味着一套模型就能跑通语音唤醒 → 意图识别 → 多轮 TTS 反馈的完整闭环,不用再为 ASR/TTS 分裂技术栈。
相关阅读