Qwen Scribe开源:Apple Silicon专属离线ASR工具,中文语音转录首字延迟<300ms

Qwen Scribe 正式开源:Apple Silicon 专属本地 ASR 工具,中文语音转录首字延迟低于 300ms,全程离线。
Qwen Scribe 是阿里巴巴通义实验室推出的轻量级、全离线语音转录引擎,专为 Apple Silicon(M1/M2/M3)优化。二进制体积 12MB,内存常驻 <80MB,支持实时听写与批量音频转录。核心模型基于 Qwen-ASR 系列蒸馏成果,采用 CTC + Transducer 混合架构,在 Aishell-3 和自建粤普混合测试集上字错误率(CER)为 4.2%。同一硬件下,Whisper.cpp 的 CER 为 7.9%。所有环节——音频预处理、声学建模、语言解码——均在设备端完成。不发网络请求,不传音频到云端,不生成外泄日志。“麦克风→文本”单链路闭环。
MIT 协议开源,支持 Rust + Core ML 部署栈,可直接编译为 macOS 命令行工具,或集成进 Swift/Cocoa 应用。
完全离线 ≠ 功能缩水
Qwen Scribe 支持:
- 热词注入(JSON 格式,运行时动态加载)
- 标点自动恢复(非规则匹配,由模型直接输出)
- 说话人粗分(基于音色聚类,无需预设人数)
- 静音自适应切分(VAD 灵敏度可调,
--vad-threshold 0.3起效)
实测 1 小时会议录音(含中英混杂、带口音普通话),M2 Pro 上总耗时 47 秒,首字延迟稳定在 280±30ms。
对比主流云端方案:
- Azure Speech:TLS 握手 + API 认证,平均首字延迟 1.2s;每小时音频处理成本约 $0.8
- 讯飞开放平台:强制上传音频至合肥服务器,企业客户需额外通过数据出境安全评估
- Whisper API:受 OpenAI 速率配额与上下文长度限制
Qwen Scribe 规避全部上述瓶颈。医疗问诊记录、法务笔录、政府内部会议等强隐私场景可直接落地。
中文语音识别的“最后一公里”
过去三年,国内开发者主要依赖 Whisper.cpp 或 Vosk 做本地 ASR,但二者对中文语境适配不足:
- Whisper.cpp 缺乏中文标点训练,句读断裂严重
- Vosk 模型体积 >500MB,启动慢,且无 Apple Silicon 原生加速支持
Qwen Scribe 首次将 Qwen 大模型生态中的语音理解能力下沉到终端:
- 声学模型经 Qwen-2-7B 多阶段蒸馏监督(教师模型 logits 作软标签)
- 语言模型复用 Qwen-Tokenizer 的 subword 分词逻辑,并针对中文停顿习惯重训 LM 权重
后续可通过 qwen-scribe-finetune 工具包,用百条自有录音(无需对齐文本)微调声学模块。例如让模型准确识别“枸橼酸西地那非片”或“鄂尔多斯盆地侏罗系”。
👉 Binance · OKX · Gate.io · HTX · Bitget
与龙虾 / OpenClaw 生态天然协同
Qwen Scribe 不依赖龙虾框架,但其输出结构化文本(含时间戳、置信度、speaker_id)可直连龙虾 Agent 的 memory layer。
OpenClaw CLI 已内置 claw transcribe --local 指令,一键调用本地 Qwen Scribe 实例,替代原有 Whisper 后端。
我们已在 yitb.com 开源仓库发布 qwen-scribe-lsp 插件,支持 VS Code 内嵌实时听写(Ctrl+Alt+T 触发),文本自动插入当前光标位置——首个面向开发者工作流、零配置的本地 ASR IDE 集成方案。
现在就能用
Qwen Scribe 不追求通用多语种覆盖,而是聚焦高价值垂直场景:隐私敏感、低延迟响应、硬件确定性。
这种“小而锐”的路径正在重塑 ASR 技术栈分工——云端负责模型迭代与知识蒸馏,终端专注推理极致优化。
你可以立刻开始:
- 克隆仓库:
git clone https://github.com/QwenLM/qwen-scribe - 编译 macOS 版本:
make build-macos 测试转录效果:
qwen-scribe-cli --audio test.wav --output json- 在 Rust/Python Agent 中调用
transcribe()函数,彻底摆脱 API 依赖
WebAssembly 版本预计 Q3 上线;Linux ARM64 移动端适配已启动。