📰 龙虾新闻

Qwen3-TTS/Qwen3-ASR开源语音双模型:毫秒级延迟+商用准确率+全链路MIT开源

发布时间:2026-09-15 分类: 龙虾新闻
摘要:Nari Labs 开源 Qwen3-TTS 和 Qwen3-ASR。这是国内首个同时满足三项硬指标的语音双模型:端到端延迟压进百毫秒、准确率达到商用级、全链路 MIT 开源。毫秒级端到端延迟:去掉中间表示,直通波形与 tokenQwen3-TTS 实测端到端延迟 87ms(RTF=0.09),Qwen3-ASR 流式首字延迟 <120ms,全部跑在单张 RTX 4090 上。 核心...

Qwen3-TTS/Qwen3-ASR开

Nari Labs 开源 Qwen3-TTS 和 Qwen3-ASR。这是国内首个同时满足三项硬指标的语音双模型:端到端延迟压进百毫秒、准确率达到商用级、全链路 MIT 开源。

毫秒级端到端延迟:去掉中间表示,直通波形与 token

Qwen3-TTS 实测端到端延迟 87ms(RTF=0.09),Qwen3-ASR 流式首字延迟 <120ms,全部跑在单张 RTX 4090 上。

核心是自研的 SpeechFlow 推理引擎:不走传统 ASR/TTS 分离流程,不生成 Mel-spectrogram,不依赖后处理模块。TTS 直接从文本 token 映射到波形采样点;ASR 则输出时间对齐的 token 序列,隐状态全程流式传递。

对比 Whisper-v3(RTF≈0.35)和 Coqui TTS(RTF≈0.62),吞吐提升 3.8 倍。部署不依赖 TensorRT 或 ONNX Runtime——PyTorch 1.13+ 即可运行。

准确率经真实场景验证,不是实验室数据

测试覆盖 AISHELL-3(中文多说话人)、Common Voice zh-CN(嘈杂环境)和自建「地铁站广播」实录集:

  • Qwen3-ASR 词错误率(WER):2.1%(干净) / 5.8%(SNR 10dB),优于 Whisper-large-v3(6.3% / 9.7%)
  • Qwen3-TTS MOS 得分:4.22(5 分制),高于 Azure Neural TTS(4.15)和 Amazon Polly(4.08);数字、专有名词、中英混读错误率下降 41%

所有测试脚本、音频样本、预处理逻辑全部随仓库公开,拒绝“调参过拟合”式 benchmark。

MIT 全链路开源:模型、训练、服务、量化,一并放出

开放内容包括:

  • 模型权重(含 int8 量化版)
  • 完整训练脚本与数据清洗 pipeline
  • production-ready FastAPI 微服务模板:支持 WebSocket 流式接口、动态批处理(max_batch=32)、CUDA Graph 开关

MIT 协议明确允许修改、分发、SaaS 封装、商业集成。国内尚无其他高质量语音模型套件在 LICENSE 层面彻底解除商用限制。
FunASR 核心 decoder 闭源,Paraformer 无配套 TTS,Qwen3 是首个闭环。

龙虾(OpenClaw)开发者可直接接入

API 设计原生兼容 OpenClaw Agent:

  • TTS 输出 audio/wav;base64,直接喂给 claw_speak() 工具
  • ASR 流式结果通过 on_partial_transcript() 回调,无缝写入 OpenClaw 多模态记忆模块

yitb.com 的 OpenClaw Playground 已上线 Qwen3-ASR 实时语音控制 demo,支持唤醒词热更新与上下文纠错。集成代码见 yitb-labs/openclaw-integrations

👉 Binance · OKX · Gate.io · HTX · Bitget

GitHub 是交付起点,不是备选渠道

暂不上架 Hugging Face,因为其 model card 强制要求自动评估和 HF Token 认证——这会引入中心化依赖和额外延迟。

当前 GitHub Release(narilabs/qwen3-speech)提供:

  • 带 CUDA Graph 编译指令的 Dockerfile
  • 树莓派 5(ARM64)交叉编译指南
  • Jetson Orin Nano 的 INT4 量化部署包

开源交付不妥协,目标是让团队摆脱云厂商 SDK 绑定。

语音栈可以独立存在

过去三年,语音模型常被当作 LLM 的下游装饰。Qwen3 的意义在于证明:专业语音栈能走出自己的技术路径——

  • 百毫秒延迟支撑实时对话 Agent
  • 商用级精度覆盖金融、医疗等严肃场景
  • MIT 许可让中小团队敢把语音做成核心功能,而非调用付费 API

当 ASR/TTS 像 requests 一样嵌入任意 AI 工程管线,多模态原生应用才算真正开始。

git clone https://github.com/narilabs/qwen3-speech
cd qwen3-speech
make serve-tts
curl -X POST http://localhost:8000/tts \
  -H "Content-Type: application/json" \
  -d '{"text": "你好,Qwen3。"}' > hello.wav

不到 90 秒,第一条合成语音就出来了。部署自由,始于你 fork 的那一刻。

语音开源 #Qwen3


相关阅读

返回首页