Qwen3-TTS/Qwen3-ASR开源语音双模型:毫秒级延迟+商用准确率+全链路MIT开源

Nari Labs 开源 Qwen3-TTS 和 Qwen3-ASR。这是国内首个同时满足三项硬指标的语音双模型:端到端延迟压进百毫秒、准确率达到商用级、全链路 MIT 开源。
毫秒级端到端延迟:去掉中间表示,直通波形与 token
Qwen3-TTS 实测端到端延迟 87ms(RTF=0.09),Qwen3-ASR 流式首字延迟 <120ms,全部跑在单张 RTX 4090 上。
核心是自研的 SpeechFlow 推理引擎:不走传统 ASR/TTS 分离流程,不生成 Mel-spectrogram,不依赖后处理模块。TTS 直接从文本 token 映射到波形采样点;ASR 则输出时间对齐的 token 序列,隐状态全程流式传递。
对比 Whisper-v3(RTF≈0.35)和 Coqui TTS(RTF≈0.62),吞吐提升 3.8 倍。部署不依赖 TensorRT 或 ONNX Runtime——PyTorch 1.13+ 即可运行。
准确率经真实场景验证,不是实验室数据
测试覆盖 AISHELL-3(中文多说话人)、Common Voice zh-CN(嘈杂环境)和自建「地铁站广播」实录集:
- Qwen3-ASR 词错误率(WER):2.1%(干净) / 5.8%(SNR 10dB),优于 Whisper-large-v3(6.3% / 9.7%)
- Qwen3-TTS MOS 得分:4.22(5 分制),高于 Azure Neural TTS(4.15)和 Amazon Polly(4.08);数字、专有名词、中英混读错误率下降 41%
所有测试脚本、音频样本、预处理逻辑全部随仓库公开,拒绝“调参过拟合”式 benchmark。
MIT 全链路开源:模型、训练、服务、量化,一并放出
开放内容包括:
- 模型权重(含 int8 量化版)
- 完整训练脚本与数据清洗 pipeline
- production-ready FastAPI 微服务模板:支持 WebSocket 流式接口、动态批处理(
max_batch=32)、CUDA Graph 开关
MIT 协议明确允许修改、分发、SaaS 封装、商业集成。国内尚无其他高质量语音模型套件在 LICENSE 层面彻底解除商用限制。
FunASR 核心 decoder 闭源,Paraformer 无配套 TTS,Qwen3 是首个闭环。
龙虾(OpenClaw)开发者可直接接入
API 设计原生兼容 OpenClaw Agent:
- TTS 输出
audio/wav;base64,直接喂给claw_speak()工具 - ASR 流式结果通过
on_partial_transcript()回调,无缝写入 OpenClaw 多模态记忆模块
yitb.com 的 OpenClaw Playground 已上线 Qwen3-ASR 实时语音控制 demo,支持唤醒词热更新与上下文纠错。集成代码见 yitb-labs/openclaw-integrations。
👉 Binance · OKX · Gate.io · HTX · Bitget
GitHub 是交付起点,不是备选渠道
暂不上架 Hugging Face,因为其 model card 强制要求自动评估和 HF Token 认证——这会引入中心化依赖和额外延迟。
当前 GitHub Release(narilabs/qwen3-speech)提供:
- 带 CUDA Graph 编译指令的 Dockerfile
- 树莓派 5(ARM64)交叉编译指南
- Jetson Orin Nano 的 INT4 量化部署包
开源交付不妥协,目标是让团队摆脱云厂商 SDK 绑定。
语音栈可以独立存在
过去三年,语音模型常被当作 LLM 的下游装饰。Qwen3 的意义在于证明:专业语音栈能走出自己的技术路径——
- 百毫秒延迟支撑实时对话 Agent
- 商用级精度覆盖金融、医疗等严肃场景
- MIT 许可让中小团队敢把语音做成核心功能,而非调用付费 API
当 ASR/TTS 像 requests 一样嵌入任意 AI 工程管线,多模态原生应用才算真正开始。
git clone https://github.com/narilabs/qwen3-speech
cd qwen3-speech
make serve-tts
curl -X POST http://localhost:8000/tts \
-H "Content-Type: application/json" \
-d '{"text": "你好,Qwen3。"}' > hello.wav不到 90 秒,第一条合成语音就出来了。部署自由,始于你 fork 的那一刻。
语音开源 #Qwen3
相关阅读