📰 龙虾新闻

Qwen3-TTS与Qwen3-ASR双模型开源:端到端语音识别合成一体化方案,延迟<192ms

发布时间:2026-09-16 分类: 龙虾新闻
摘要:Nari Labs 开源 Qwen3-TTS 和 Qwen3-ASR:一套端到端可训练的语音双模型,实测端到端延迟 <192ms,MOS ≥4.1,WER 4.17%(LibriSpeech test-clean),目前位列 Hacker News 热榜 Top 5。它不走传统 ASR+TTS 分离流水线的老路,也不依赖外部 duration predictor、vocoder 或后处...

Qwen3-TTS与Qwen3-ASR双

Nari Labs 开源 Qwen3-TTS 和 Qwen3-ASR:一套端到端可训练的语音双模型,实测端到端延迟 <192ms,MOS ≥4.1,WER 4.17%(LibriSpeech test-clean),目前位列 Hacker News 热榜 Top 5。

它不走传统 ASR+TTS 分离流水线的老路,也不依赖外部 duration predictor、vocoder 或后处理模块。Qwen3-ASR 和 Qwen3-TTS 共享 Qwen3 的 tokenizer、RoPE 位置编码和 encoder-decoder backbone,在统一架构下联合优化语音理解与生成。

  • Qwen3-ASR 支持流式 chunking(64ms/chunk),语音输入后 83ms 输出首个 token;
  • Qwen3-TTS 使用 latency-aware monotonic alignment,文本 token 到波形输出仅需 109ms(A10 GPU,batch=1,FP16 + FlashAttention-2);
  • 单张 A10(24GB)可同时运行 ASR+TTS 推理服务,吞吐达 12.4 RTF,推理成本仅为 Whisper-v3 + Coqui TTS 组合的 37%。

开源即生产就绪

全部开源:模型权重、训练脚本、微调 pipeline、ONNX 导出工具、FastAPI 部署模板,Apache 2.0 协议,无商业限制。
提供预编译 wheel 包:pip install qwen3-speech 即可启动本地服务。
支持热插拔方言适配:已内置粤语、日语、韩语微调 checkpoint;在单张 RTX 3090 上,用 <50 小时音频数据微调新语种,2 小时内即可达成 WER <5.2%。

技术底座:为什么能压到 200ms 内?

三个关键改动:

  1. 去掉 Mel-spectrogram 计算,用可学习的 Conv1D projection head 直接将原始波形映射到 Qwen3 嵌入空间;
  2. ASR decoder 和 TTS encoder 共享 cross-attention 的 key/value cache,避免对同一段语音重复编码;
  3. 引入 token-level latency scheduling:每个输出 token 动态裁剪 attention span(最大 512 tokens),KV cache 显存占用下降 68%;
    实测 A10 上单次 ASR 推理显存峰值 3.2GB,TTS 为 4.1GB。

对 AI 工程师的真实价值

这不是又一个“能跑 demo”的 TTS/ASR 模型,而是能嵌进实时 Agent 交互链路的语音原语。龙虾(Longxia)Agent 已验证其与 OpenClaw 控制协议的兼容性:

  • longxia run --voice 模式下,用户语音 → Qwen3-ASR 转写 → Planner 处理 → Qwen3-TTS 合成响应,端到端延迟稳定在 310ms(含网络传输),远低于传统方案(平均 850ms+);
  • 树莓派 5 + USB 麦克风可跑带语音反馈的轻量 Agent;
  • 边缘设备上部署免联网客服前端,推理成本趋近于零。

👉 Binance · OKX · Gate.io · HTX · Bitget

行业冲击已在发生

闭源语音 API(如 Azure Speech、AWS Transcribe/Polly)依赖长上下文重计算和中心化调度,P99 延迟普遍 >600ms,且按小时计费。Qwen3 双模型把语音能力拉回本地——

  • GitHub 上 48 小时内已有 17 个 fork 完成硬件适配(Jetson Orin、Mac M2 Ultra、Intel Arc A770);
  • 其中 3 个项目上线生产:

    • 深圳某智能会议硬件厂商将其集成进会议纪要终端,ASR 准确率提升 11.3%(尤其中英混说场景),整机功耗下降 40%;
    • 某教育 SaaS 公司用其替代 Twilio Speech,月语音处理成本从 $24,000 降至 $3,100。

下一步怎么用?

立刻 clone 并 benchmark:

git clone https://github.com/nari-labs/qwen3-speech  
cd qwen3-speech && pip install -e .  
python examples/stream_asr.py --device cuda:0  # 实时麦克风识别  
python examples/tts_serve.py --port 8001       # 启动 TTS API  

重点测试 --low_latency_mode 参数组合,观察不同 batch_size 下的 RTF 波动。如果你正在构建语音优先的 AI Agent(包括龙虾/OpenClaw 用户),建议直接替换现有语音模块——它不只是省成本,更带来底层可控性:比如在用户语句未结束时,Agent 已开始生成响应草稿(speculative decoding + early exit),这是闭源方案因黑盒调度无法提供的能力。

语音不该是 AI 应用的最后一公里障碍,而应是第一触点。Qwen3-TTS/ASR 不是终点,而是开源语音栈的 v1.0 标杆——当延迟、精度、成本、可控性全部达标,真正的实时多模态 Agent 才真正起步。

👉 GitHub 地址:https://github.com/nari-labs/qwen3-speech


相关阅读

返回首页