📰 龙虾新闻

Qwen3-TTS与Qwen3-ASR开源:毫秒级端到端语音模型,支持vLLM/llama.cpp无缝对接

发布时间:2026-09-17 分类: 龙虾新闻
摘要:Nari Labs 开源 Qwen3-TTS 和 Qwen3-ASR:第一套原生嵌入 Qwen3 架构的语音模型,端到端延迟压进毫秒级,已上架 Hugging Face,与 vLLM、SGLang、llama.cpp 无缝对接。实测 A10G 单卡:TTS 首字 WAV 输出 ≤118ms,ASR 在 LibriSpeech test-clean 上 WER 2.8%,推理成本比 Whisp...

Qwen3-TTS与Qwen3-ASR开

Nari Labs 开源 Qwen3-TTS 和 Qwen3-ASR:第一套原生嵌入 Qwen3 架构的语音模型,端到端延迟压进毫秒级,已上架 Hugging Face,与 vLLM、SGLang、llama.cpp 无缝对接。

实测 A10G 单卡:TTS 首字 WAV 输出 ≤118ms,ASR 在 LibriSpeech test-clean 上 WER 2.8%,推理成本比 Whisper + Coqui 组合低 67%。语音模块直接复用 Qwen3 的 KV 缓存和 RoPE,跳过中间文本序列化——ASR 输出的 hidden states 能直通 TTS decoder 起始位置,不走 JSON、不拼字符串、不触发 CPU 解析。

原生架构对齐:语音不是插件,是 Qwen3 的一部分

Qwen3-TTS 和 Qwen3-ASR 没有在 Qwen3 上“套壳”。它们从底层重构了 Decoder-only 结构:

  • TTS:把音素 + 韵律标记(如 <pitch:high><duration:1.2>)作为特殊 token 加进原始词表,共享嵌入层和 RoPE 旋转矩阵;
  • ASR:将梅尔谱图切片后,经轻量 Conv-Transformer 投影器转成视觉 token,和语言 token 共用同一 KV 缓存池。

这意味着,当 ASR 识别出 “生成 Python 代码”,它的最后一层 hidden state 可以直接喂给 TTS decoder 的第一个位置——没有中间文本、没有格式转换、没有额外调度开销。

A10G 单卡实测:15 秒音频 → 文本 → 语音全链路吞吐 42 req/s。

工程即战力:三行代码接入现有服务

模型已发布至 Hugging Face:

  • nari-labs/qwen3-asr-base
  • nari-labs/qwen3-tts-base

提供标准 pipeline() 接口和 Qwen3SpeechModel 类封装。预处理(梅尔归一化、音素 mask 生成)全内置,输出 tensor 形状与 Qwen3 原生一致:[batch, seq_len, hidden_size]

from transformers import Qwen3SpeechModel, AutoProcessor
model = Qwen3SpeechModel.from_pretrained("nari-labs/qwen3-asr-base")
processor = AutoProcessor.from_pretrained("nari-labs/qwen3-asr-base")
text = model.generate(processor(audio, return_tensors="pt"), max_new_tokens=128)

对比 Whisper 需要 FastTokenizer + FFmpeg + Gradio 多层胶水,Qwen3-ASR/TTS 可直接启用 vLLM 的 --enable-prefix-caching,多轮语音对话共享 KV cache,显存更稳、延迟更低。

生态穿透力:直连 OpenClaw 和 龙虾 Agent

龙虾(yitb.com)当前依赖外部 ASR 解析语音指令,卡在三处:跨服务鉴权、音频格式转换、时序对齐。

Qwen3-ASR 输出格式为 <|asr_start|>open browser<|asr_end|>,OpenClaw 的 ActionParser 可直接消费,无需正则提取或 LLM 二次校验;
Qwen3-TTS 输出的 WAV tensor 能直送龙虾 WebRTC SDK 的 audioContext 输入节点,跳过 Base64 编码和 HTTP chunking。

龙虾 v0.9.3 测试分支实测:语音唤醒 → 意图识别 → 执行 → 反馈语音的 P95 延迟从 1.8s 降至 410ms,GPU 显存稳定在 7.2GB(原方案峰值 11.4GB)。

👉 Binance · OKX · Gate.io · HTX · Bitget

硬核参数与实测边界

  • 硬件要求:最低 A10G(24GB VRAM),FP16;AWQ 4-bit 量化版可在 RTX 4090(24GB)跑实时双工语音
  • 精度基准

    • ASR:Common Voice zh-CN(v17)WER = 3.1%
    • TTS:MOS 4.21(专业盲测)
  • 延迟实测(A10G + vLLM 0.6.3):

    • ASR:8s 音频平均延迟 380ms(含预处理),首字识别 210ms
    • TTS:生成 12s 语音耗时 690ms,首字 WAV 输出 118ms
  • 当前限制

    • 方言混合语句、超长停顿(>2.5s)需手动切片
    • 暂未开放多说话人克隆接口

下一步:补全 Qwen3 的语音 IO

这不是 Whisper 或 VITS 的替代品,而是解决“Qwen3 原生场景下语音输入输出的最后一公里”。

语音成为 Qwen3 的一级数据模态——和文本一样直接参与 attention、共享缓存、共用训练流程。

你可以用 qwen3-instruct 微调脚本直接 finetune ASR;用 Qwen3 的 LoRA 机制同步优化语言理解和语音生成权重;训练闭环真正统一。

全部训练日志和 vLLM 适配补丁已在 GitHub 公开。

立刻开始:
前往 Hugging Face 仓库 下载模型,pip install transformers>=4.45.0 后,把你的 Qwen3 服务升级为语音原生体。
如果正在构建 Agent 语音界面,建议优先替换 ASR 模块——它比你预想的更接近“开箱即用”。


相关阅读

返回首页