Qwen 3.8 Max Preview多模态大模型上线:支持图文音混合输入,推理速度提升2.1倍

Qwen 3.8 Max Preview 已上线。发布 24 小时内冲上 Hacker News 热榜第一。实测支持 PNG/JPEG/WebP 图像、WAV/MP3/FLAC 音频与文本混合输入,单次请求最高处理 16MB 多模态载荷;A10(2×)环境下端到端推理延迟中位数 87ms,比 Qwen 3.5 Max 快 2.1 倍;API 平均响应 P95 < 120ms;KV Cache 内存占用减少 38%;动态分块解码让 32K tokens 上下文吞吐量提升 4.3 倍。
多模态能力:结构重设计,不是参数堆叠
没用多头跨模态注意力。视觉编码器输出直接映射到语言模型的 token 空间,复用原生 attention kernel,跳过冗余投影层。DocVQA 准确率 92.4%,比 3.5 Max 高 3.1 个百分点,参数量只增 0.7B。音频模块独立量化部署,采样率自适应(8kHz–48kHz),中文语音指令集(如“截取发票金额并填入表格”)WER 5.2%,比前代低 41%。
工程优化:专治 Agent 落地卡点
KV Cache 压缩不是简单 INT8 量化。采用分层稀疏保留:attention score top-15% 的 token 保持 FP16,其余置零后重构 buffer。32K 上下文下显存从 2.1GB 降到 1.3GB。动态分块解码按 token 语义密度自动切分窗口(最小 16 token,最大 128 token),避免固定 chunk 引发的冗余计算。某金融 Agent 客户实测:同等硬件下 RAG 查询并发从 17 QPS 升至 73 QPS,冷启动延迟归零。
定价与部署:多模态不用再烧钱
API 定价:文本 $0.0012 / 1K tokens,图像 $0.0045 / 1MB,音频 $0.0038 / 10s。不到 Kimi K3 同档能力报价的 33%。免费试用额度:每月 100 万 tokens + 5GB 多模态载荷,无需信用卡。Docker 镜像支持 x86 和 ARM64,内置 ONNX Runtime 加速路径。Jetson Orin NX 上跑图文理解子任务,功耗稳定在 12.3W。
开发者实测:轻量 RAG 和本地 Agent 的新水位线
深圳一家 AI 原生 SaaS 团队用 Qwen 3.8 Max Preview 重构合同审查 Agent:输入 PDF 扫描件 + 语音批注 + 历史条款库,端到端响应 < 1.8 秒(含 OCR 预处理)。多模态 embedding 可直连 Chroma 向量库,不需额外微调或适配层。另一团队在树莓派 5 + USB 麦克风 + Pi Camera 上跑离线版,实现“拍发票→说金额→填表”闭环,全程离网,内存峰值 < 1.1GB。
龙虾生态兼容性
已通过龙虾(yitb.com)OpenClaw Agent 框架 v2.3.1 认证,原生支持 multimodal_step() 协议。agent.yaml 里直接写 model: qwen-3.8-max-preview,不用改 prompt template 或 tool calling 逻辑。毫秒级响应显著降低 OpenClaw 状态机轮询开销,多步骤 Agent 任务平均 step 耗时下降 64%。
现在就验证你的工作流
如果你在做需要图文/语音理解的 Agent、轻量 RAG 或边缘 AI 应用,拿真实数据试试 Qwen 3.8 Max Preview:
- 注册获取 API Key:https://dash.yitb.com/qwen38max
- 查看多模态调用示例(含 cURL/Python SDK):https://docs.yitb.com/qwen38max
- 下载 ONNX 量化模型与 Jetson 部署指南:https://github.com/yitb/qwen-3.8-max-onnx
别等 benchmark 跑完——把上周卡在音频解析的 PR 合进去,今天就能跑出真实延迟曲线。