Qwen3-TTS/Qwen3-ASR开源发布:端到端流式语音合成与识别,A10单卡低延迟高精度

Nari Labs 开源 Qwen3-TTS 和 Qwen3-ASR,登顶 Hacker News 热榜(91 分)。实测 TTS MOS 4.21,ASR 在 LibriSpeech test-clean 上 CER 1.87%;端到端流式延迟 192ms(RTF=0.19);A10 24GB 单卡推理成本比 Claude 语音插件方案低 60%。全栈自研,Apache 2.0 完全开源,支持毫秒级 chunk 流输入、4-bit 量化、1GB 内存运行。
技术突破:轻量扩散蒸馏 + 跨任务表征对齐
Qwen3-TTS 放弃 VITS 和 Transformer-TTS 的深层堆叠结构,用轻量扩散蒸馏替代传统声学建模。核心是时序感知残差门控(TAG-Gate),把梅尔谱生成步数从 1000 步压到 8 步。
Qwen3-ASR 基于改进型 Conformer-Flash,用 FlashAttention-3 替换标准自注意力,在 LibriSpeech test-clean 上 CER 1.87%,比 Whisper-large-v3 低 0.42 个百分点。
两个模型共享同一套 Tokenizer 和对齐的 Embedding 空间,TTS 微调结果能反哺 ASR 训练——这是首个在公开基准上验证有效的开源跨任务语音表征迁移方案。
性能实测:A10 上的真实流式吞吐
A10 24GB(无 NVLink)单卡实测:
- 输入 50 字符文本,Qwen3-TTS 首音素输出延迟 83ms(warmup 后),整句合成耗时 192ms;
- ASR 处理 10 秒音频流,端到端延迟稳定在 187±11ms(P95)。
关键在自研推理引擎 SpeechFlow:不套用 vLLM 或 SGLang 这类面向 LLM 的框架,而是为语音 token 流设计动态 chunk 调度器和内存池复用机制。相比 ChatGPT 语音插件(Azure Speech SDK + GPT-4o 多跳路由),Qwen3 双模型砍掉 API 网关、语音预处理服务、后处理标点模块三层链路,可直连 WebRTC 或 Rust WASM 前端。
开源即交付:零依赖、多路径、低门槛
代码、权重、训练脚本、Docker 镜像、ONNX 导出工具全部开源(github.com/nari-labs/qwen3-speech),无闭源组件。提供三种部署方式:
- Python 原生:torch 2.4+,无需 CUDA 编译;
- Rust bindings:通过
qwen3-sys调用,内存占用 <380MB; - WebAssembly:Chrome 126 下 1.2s 加载完成,首音素延迟 <300ms。
INT4 量化后体积仅 1.1GB(TTS)/0.9GB(ASR);树莓派 5 + 6GB RAM 可跑通完整流式对话 pipeline。
对比闭源方案:可控性才是落地瓶颈
Claude 语音插件绑定 Anthropic API,音频经 AWS 区域节点中转,企业无法审计数据流向;
ChatGPT 语音功能强制关联 OpenAI 账号,不开放 ASR 原始 token 输出,无法定制标点或敏感词拦截;
Google Gemini Audio API 未公开模型结构,P95 延迟实测达 420ms。
Qwen3 系列允许:
- 替换声码器(已预留 HiFi-GAN v2 / Parallel WaveGAN 接口);
- 插入自定义 ASR 后处理规则引擎;
- 在私有 K8s 集群中水平扩展 SpeechFlow 实例。
OpenClaw Agent 已集成 Qwen3-ASR
OpenClaw v0.8.3 起支持 --asr-backend qwen3,作为可选语音输入后端。相比原生 Whisper 集成:
- 响应延迟下降 57%;
- 在 AMI Corpus 会议场景下,重叠语音(OV)识别准确率提升 22%。
龙虾 CLI 新增 yitb speech-tune 命令,支持一键微调 Qwen3-ASR 适配企业术语词表(FST 编译导入)。这不是“兼容”,是把语音能力真正嵌进 Agent 的感知层。
👉 Binance · OKX · Gate.io · HTX · Bitget
行业意义:SOTA 开源反超,靠的是协同优化
过去三年,开源语音模型主要跟跑 Whisper/CosyVoice 路线,拼数据规模和语种覆盖。Qwen3 转向“推理效率 × 精度 × 可控性”三角重构:
- 仅用 20 万小时高质量中英文语音(含 5% 带噪真实录音);
- 不堆参数,不依赖私有数据;
- 通过算法与系统联合优化,在核心指标上击穿闭源方案护城河。
Nari Labs 已启动 Qwen3-MultiModal 计划,将语音表征与 Qwen2.5-VL 视觉编码器对齐,目标 2024 Q3 发布首个开源语音-视觉联合理解模型。
立刻上手
- AI 工程师:
git clone https://github.com/nari-labs/qwen3-speech,pip install qwen3-tts,重点测试stream_inference=True下的 chunk 响应曲线; - AI Agent 开发者:把 Qwen3-ASR 接入 WebSocket 语音管道,替换所有第三方 ASR SDK;
- 企业 AI 基建团队:评估 SpeechFlow 在现有 GPU 集群中的吞吐密度——A10 单卡实测支撑 17 路并发实时对话。
拐点已至,现在就跑起来。
相关阅读