📰 龙虾新闻

Qwen3-TTS/Qwen3-ASR开源发布:端到端流式语音合成与识别,A10单卡低延迟高精度

发布时间:2026-09-21 分类: 龙虾新闻
摘要:Nari Labs 开源 Qwen3-TTS 和 Qwen3-ASR,登顶 Hacker News 热榜(91 分)。实测 TTS MOS 4.21,ASR 在 LibriSpeech test-clean 上 CER 1.87%;端到端流式延迟 192ms(RTF=0.19);A10 24GB 单卡推理成本比 Claude 语音插件方案低 60%。全栈自研,Apache 2.0 完全开源,...

Qwen3-TTS/Qwen3-ASR开

Nari Labs 开源 Qwen3-TTS 和 Qwen3-ASR,登顶 Hacker News 热榜(91 分)。实测 TTS MOS 4.21,ASR 在 LibriSpeech test-clean 上 CER 1.87%;端到端流式延迟 192ms(RTF=0.19);A10 24GB 单卡推理成本比 Claude 语音插件方案低 60%。全栈自研,Apache 2.0 完全开源,支持毫秒级 chunk 流输入、4-bit 量化、1GB 内存运行。

技术突破:轻量扩散蒸馏 + 跨任务表征对齐

Qwen3-TTS 放弃 VITS 和 Transformer-TTS 的深层堆叠结构,用轻量扩散蒸馏替代传统声学建模。核心是时序感知残差门控(TAG-Gate),把梅尔谱生成步数从 1000 步压到 8 步。
Qwen3-ASR 基于改进型 Conformer-Flash,用 FlashAttention-3 替换标准自注意力,在 LibriSpeech test-clean 上 CER 1.87%,比 Whisper-large-v3 低 0.42 个百分点。
两个模型共享同一套 Tokenizer 和对齐的 Embedding 空间,TTS 微调结果能反哺 ASR 训练——这是首个在公开基准上验证有效的开源跨任务语音表征迁移方案。

性能实测:A10 上的真实流式吞吐

A10 24GB(无 NVLink)单卡实测:

  • 输入 50 字符文本,Qwen3-TTS 首音素输出延迟 83ms(warmup 后),整句合成耗时 192ms;
  • ASR 处理 10 秒音频流,端到端延迟稳定在 187±11ms(P95)。

关键在自研推理引擎 SpeechFlow:不套用 vLLM 或 SGLang 这类面向 LLM 的框架,而是为语音 token 流设计动态 chunk 调度器和内存池复用机制。相比 ChatGPT 语音插件(Azure Speech SDK + GPT-4o 多跳路由),Qwen3 双模型砍掉 API 网关、语音预处理服务、后处理标点模块三层链路,可直连 WebRTC 或 Rust WASM 前端。

开源即交付:零依赖、多路径、低门槛

代码、权重、训练脚本、Docker 镜像、ONNX 导出工具全部开源(github.com/nari-labs/qwen3-speech),无闭源组件。提供三种部署方式:

  • Python 原生:torch 2.4+,无需 CUDA 编译;
  • Rust bindings:通过 qwen3-sys 调用,内存占用 <380MB;
  • WebAssembly:Chrome 126 下 1.2s 加载完成,首音素延迟 <300ms。

INT4 量化后体积仅 1.1GB(TTS)/0.9GB(ASR);树莓派 5 + 6GB RAM 可跑通完整流式对话 pipeline。

对比闭源方案:可控性才是落地瓶颈

Claude 语音插件绑定 Anthropic API,音频经 AWS 区域节点中转,企业无法审计数据流向;
ChatGPT 语音功能强制关联 OpenAI 账号,不开放 ASR 原始 token 输出,无法定制标点或敏感词拦截;
Google Gemini Audio API 未公开模型结构,P95 延迟实测达 420ms。

Qwen3 系列允许:

  • 替换声码器(已预留 HiFi-GAN v2 / Parallel WaveGAN 接口);
  • 插入自定义 ASR 后处理规则引擎;
  • 在私有 K8s 集群中水平扩展 SpeechFlow 实例。

OpenClaw Agent 已集成 Qwen3-ASR

OpenClaw v0.8.3 起支持 --asr-backend qwen3,作为可选语音输入后端。相比原生 Whisper 集成:

  • 响应延迟下降 57%;
  • 在 AMI Corpus 会议场景下,重叠语音(OV)识别准确率提升 22%。

龙虾 CLI 新增 yitb speech-tune 命令,支持一键微调 Qwen3-ASR 适配企业术语词表(FST 编译导入)。这不是“兼容”,是把语音能力真正嵌进 Agent 的感知层。

👉 Binance · OKX · Gate.io · HTX · Bitget

行业意义:SOTA 开源反超,靠的是协同优化

过去三年,开源语音模型主要跟跑 Whisper/CosyVoice 路线,拼数据规模和语种覆盖。Qwen3 转向“推理效率 × 精度 × 可控性”三角重构:

  • 仅用 20 万小时高质量中英文语音(含 5% 带噪真实录音);
  • 不堆参数,不依赖私有数据;
  • 通过算法与系统联合优化,在核心指标上击穿闭源方案护城河。

Nari Labs 已启动 Qwen3-MultiModal 计划,将语音表征与 Qwen2.5-VL 视觉编码器对齐,目标 2024 Q3 发布首个开源语音-视觉联合理解模型。

立刻上手

  • AI 工程师:git clone https://github.com/nari-labs/qwen3-speechpip install qwen3-tts,重点测试 stream_inference=True 下的 chunk 响应曲线;
  • AI Agent 开发者:把 Qwen3-ASR 接入 WebSocket 语音管道,替换所有第三方 ASR SDK;
  • 企业 AI 基建团队:评估 SpeechFlow 在现有 GPU 集群中的吞吐密度——A10 单卡实测支撑 17 路并发实时对话。
    拐点已至,现在就跑起来。

相关阅读

返回首页