📰 龙虾新闻

Qwen3-TTS与Qwen3-ASR开源:端到端延迟<180ms,WER 4.2%,A10单卡流式推理

发布时间:2026-09-16 分类: 龙虾新闻
摘要:Nari Labs 开源 Qwen3-TTS 与 Qwen3-ASR:端到端延迟 &lt;180ms,WER 4.2%,A10 单卡跑满流式推理 Qwen3-TTS(文本转语音)和 Qwen3-ASR(自动语音识别)正式开源。两个模型都面向实际部署场景设计:轻量、低延迟、高精度,且原生支持 chunked streaming。实测数据如下:Qwen3-ASR 在 LibriSpeech t...

Qwen3-TTS与Qwen3-ASR开

Nari Labs 开源 Qwen3-TTS 与 Qwen3-ASR:端到端延迟 <180ms,WER 4.2%,A10 单卡跑满流式推理

Qwen3-TTS(文本转语音)和 Qwen3-ASR(自动语音识别)正式开源。两个模型都面向实际部署场景设计:轻量、低延迟、高精度,且原生支持 chunked streaming。实测数据如下:

  • Qwen3-ASR 在 LibriSpeech test-clean 上 WER 为 4.2%
  • Qwen3-TTS 在 VCTK 上 MOS 达 4.12
  • A10 单卡吞吐达 12× 实时(RTF = 0.083)
  • 首字节延迟中位数 167ms(含预热)

模型权重、训练脚本、ONNX 导出工具、Rust 推理示例全部公开,无闭源组件,仓库地址:nari-labs/qwen3-speech

架构级优化:为流式语音推理重写

Qwen3-ASR 不用 Conformer + CTC/Attention 老路,改用 Dual-Path State-Space Model(DP-SSM)。帧级状态更新压缩到 32 维隐状态,跳过 RNN 层级展开,省掉大量冗余计算。

Qwen3-TTS 基于分层扩散蒸馏(Hierarchical Diffusion Distillation),用 1-bit residual vector quantization 替代 HiFi-GAN vocoder。解码步数从 50 降到 8,FP16 显存占用压到 1.7GB。

两者共享同一套 tokenization(128-token vocab):ASR 输出 token 可直连 TTS 输入,不用额外文本后处理。

工程友好:能在边缘跑,也能进实时对话环

默认导出 ONNX Runtime 兼容格式,附带量化感知训练(QAT)配置:

  • INT8 推理下,ASR WER 从 4.2 → 5.1(+0.9p)
  • TTS MOS 从 4.12 → 3.97(-0.15)

Jetson Orin NX 实测:

  • ASR RTF = 0.31
  • TTS RTF = 0.44

配套 rust-inference crate 支持 zero-copy audio buffer 处理,API 设计参考 whisper.cpp:无 Python 依赖、无后台线程、可编译进 WASM 或裸机环境。已接入 OpenClaw Agent 的 voice-loop pipeline——ASR 输出经 LLM Router 后,TTS 直接驱动音频 DMA,端到端延迟稳定在 220±15ms。

当前限制:不遮掩,列清楚

  • 没有第三方基准报告:未测 AISHELL-1、Common Voice 17 等数据集,也未公布训练数据构成比例或去标识化流程
  • 语言支持有限:ASR 仅中文普通话;TTS 支持中英混合合成,不支持方言或小语种
  • 无托管 API:所有推理必须本地部署;GitHub README 中 “cloud inference roadmap” 仍标为 TBD
  • 社区复现发现:HuggingFace Spaces 上首个 Qwen3-ASR demo 因缺少声学前端(如 Kaldi-style CMVN),在信噪比 <15dB 场景下 WER 飙升至 11.3%

👉 Binance · OKX · Gate.io · HTX · Bitget

行业意义:把“实时语音”的标准拉回亚 200ms

Qwen3 系列不是堆参数:ASR 320M、TTS 280M,远小于 Whisper-large-v3(1.5B)或 SeaSpeech(900M)。但它砍掉了冗余 attention head,用 state-space 替代 transformer block,并把语音时序约束硬编码进结构里——工程延迟从秒级压进亚 200ms 区间。

这直接动摇语音 SaaS 的定价逻辑。如果企业能用 1/5 成本自建同等体验的语音入口,Azure Cognitive Services 和 AWS Transcribe 的按小时计费模式就难再站住脚。更重要的是,它证明了一条可行路径:语音模块不必是大模型——当 ASR/TTS 能作为轻量 kernel 嵌入 Agent runtime,OpenClaw、Manus 这类自主体框架才真正有了低延迟语音交互底座。

开发者行动建议

  • 克隆仓库,运行 cargo run --example asr_stream 测试麦克风直连流式识别
  • 快速集成优先选 ONNX 版本 + onnxruntime-genai(v0.9+),避开 PyTorch CUDA context 冲突
  • 生产环境慎用静音检测:当前模型无内置 VAD,建议前置 WebRTC VAD 或 Silero VAD
  • 关注下周发布的 qwen3-bench 工具包:CLI 形式,支持 x86 / Jetson / RPi5,自动测 latency / accuracy / power 三维度指标

相关阅读

返回首页