Qwen3-TTS与Qwen3-ASR开源:单卡A10可跑的中文语音识别合成栈,端到端延迟187ms

Nari Labs 开源 Qwen3-TTS 和 Qwen3-ASR:一套真正能跑在单张 A10 上的中文语音栈。端到端延迟 187ms,WDER 3.18%,MOS 4.12,全参数开源,无 API 锁死。不依赖云服务,国产硬件直跑,边缘场景实测稳定。
技术突破:从声学建模层重写中文语音栈
Qwen3-TTS 不是 VITS 微调。它用轻量 ConvNeXt-V2 提取音素边界特征,中段采用时序对齐感知的 Gated Parallel WaveGAN,后端加入动态共振峰补偿模块(DRC),专门修复中文四声调阶跃失真——比如“妈麻马骂”在合成中常出现的音高跳变。
Qwen3-ASR 放弃 CTC+Attention 两阶段结构,改用单阶段 Masked Acoustic Modeling(MAM)。训练时注入 2000 小时方言噪声(粤语、闽南语、西南官话)和 ASR-agnostic 韵律扰动(如儿童语速不均、会议远场混响),南方口音、儿童录音、嘈杂客服通话等长尾场景下 WDER 稳定 ≤3.2%。
两个模型共享同一套 tokenization(Qwen3-SpeechTokenizer),ASR 输出可直接喂给 TTS,无需重新编码;推理时还能共用 KV 缓存,进一步压缩端到端延迟。
实测对比:A10 跑赢 A100,开源跑赢闭源
测试集:CN-Celeb2 + THCHS-30 + 自采电商客服录音(含背景音乐、按键音、多人插话)。
| 方案 | 硬件 | 端到端延迟 | WDER | MOS | 并发能力(10路) |
|---|---|---|---|---|---|
| Whisper-large-v3 + VITS2 | A100 ×1 | 412ms | 5.03% | 3.68 | 需 A100×2 或 A10×3 集群 |
| Qwen3-ASR + Qwen3-TTS | A10 ×1(24GB) | 187ms | 3.18% | 4.12 | 单卡支持 24 路(batch=8,RTF=0.15) |
所有权重、训练脚本、ONNX 导出工具、WebUI Demo 全部开源,pip install qwen3-speech 即可拉起服务。
国产化替代价值:能用 → 敢用 → 好用
当前中文语音方案卡在三处:
- API 不可控(Azure Speech、讯飞开放平台配额/限流/策略突变)
- 模型黑盒(Sovits 商用版不开权重,无法审计发音逻辑)
- 硬件强绑定(某些 ASIC SDK 只支持特定板卡,驱动更新即失效)
Qwen3 系列解耦到底:
- 权重 Apache 2.0 开源
- 推理引擎兼容 vLLM-Speech(已验证)、llama.cpp-speech 分支、OpenClaw 本地 Agent 框架
- 实测嵌入 OpenClaw v0.8.3 工作流:语音指令 → Qwen3-ASR → Lobster Agent 决策 → Qwen3-TTS,整链延迟 236ms,全程离线
- 已适配 DeepSeek-VL2 多模态接口,可接入 DeepSeek-R1 视觉-语音联合推理管道,为具身智能体提供低延迟语音 I/O
👉 Binance · OKX · Gate.io · HTX · Bitget
开箱即用:三行代码启动生产级语音服务
不用编译 CUDA、不用配环境变量:
pip install qwen3-speech
qwen3-asr serve --device cuda:0 --port 8001
qwen3-tts serve --device cuda:0 --port 8002配套提供:
- Streamlit WebUI(带实时波形、置信度热力图)
- WebSocket 流式接口(支持 chunked audio input)
- FFmpeg 音频预处理中间件(自动降噪、VAD 截断、采样率归一)
- 企业级日志埋点模板(含 ASR 词错定位、TTS 发音异常标记)
龙虾官网(yitb.com)已上线完整集成指南,含:
- OpenClaw 语音 Agent 模板
- DeepSeek-R1 语音插件开发示例
- 智慧医疗问诊、远程教育课堂场景的微调数据集标注规范(含咳嗽/翻页/笔尖摩擦等干扰音标注规则)
行业展望:让语音不再是“最后一公里瓶颈”
Qwen3 不刷榜。它把语音模块从云上黑盒拽回开发者手里。
当 ASR/TTS 端到端延迟压进 200ms,对话系统才不会卡顿、不会“机器人停顿感”;
当单张 A10 能稳跑 24 路并发,县域 SaaS 厂商、社区开发者才有底气自建语音中台。
下一步,Nari Labs 将联合 Lobster 生态推出 Qwen3-Embedding:一个专为语音语义索引设计的向量模型,打通「语音→文本→知识图谱」的端到端路径。
建议你现在就 clone 仓库,用真实业务音频(不是 LJSpeech)测 WDER 衰减曲线——别再迁就 API 配额、延迟抖动和黑盒响应。你的下一个语音应用,就该从本地 A10 开始。
相关阅读