📰 龙虾新闻

DeepSeek V4.1 Flash内测上线:轻量级MoE架构支持图文联合编码,单卡A10G高效推理

发布时间:2026-09-10 分类: 龙虾新闻
摘要:《DeepSeek V4.1 Flash启动内测:新架构+更低成本,或成首个面向开发者的轻量级V4替代方案》DeepSeek 开放 V4.1 Flash 内测,代号 deepseek-v4.1-flash-expires-on-0910,即日起向注册开发者开放接入。这不是 V4 的微调补丁,而是基于稀疏混合专家(MoE)从头训练的轻量级推理模型,原生支持文本与图像 token 联合编码——图...

DeepSeek V4.1 Flash内

《DeepSeek V4.1 Flash启动内测:新架构+更低成本,或成首个面向开发者的轻量级V4替代方案》

DeepSeek 开放 V4.1 Flash 内测,代号 deepseek-v4.1-flash-expires-on-0910,即日起向注册开发者开放接入。这不是 V4 的微调补丁,而是基于稀疏混合专家(MoE)从头训练的轻量级推理模型,原生支持文本与图像 token 联合编码——图像嵌入与文本 token 共享同一嵌入空间、同一层归一化和注意力机制,不是后融合,也不是双塔拼接。

实测在单张 A10G 上,输入 2k tokens + 1 张图 + 输出 512 tokens 时,吞吐达 128 token/s;单位 token 成本比 V4-Flash 低 37%(相同 batch_size 和 context 长度)。对 API 用户来说,这意味着多轮对话 Agent 的端到端延迟可压进 800ms,不改基础设施,不换 base_url,只改 model 参数就能灰度验证。

全新架构:MoE + 原生多模态,不是“加个视觉头”

V4.1 Flash 抛弃了 V4 系列沿用的纯文本 Transformer 主干,改用动态路由 MoE:共 16 个专家,每次前向激活其中 4 个,总参数约 22B,激活参数约 5.5B,KV 缓存占用降低 41%。

图像路径使用 ViT-H/14 编码,输出直接映射到与文本 token 对齐的嵌入空间,共享 LayerNorm 和注意力权重。没有额外的视觉适配层,也没有 LoRA 注入。在 ChartQA 和 DocVQA 子集上 F1 达 78.3%,高于同尺寸 Qwen2-VL(72.1%),且无需定制 prompt。

性能实测:速度与成本双突破,开发者可立即验证

测试环境:vLLM 0.6.3 + 单张 A10G + max_model_len=8192

  • 输入 2048 tokens 文本 + 1 张 512×512 图:V4.1 Flash 首 token 延迟 112ms,V4-Flash 为 198ms
  • 连续 10 轮对话(每轮平均 320 tokens):端到端 P95 延迟从 2.1s 降至 1.3s
  • 单日 100 万 token 请求(含图像):成本从 $18.6 降至 $11.7(按当前公开定价换算)

注意:当前内测强制 temperature=0.7,禁用 logprobs。适合生成类任务,暂不推荐用于确定性推理(如结构化提取、校验逻辑)。

接入零改造:同价、同限流、同接口,但有硬约束

只需把请求中的 model="deepseek-v4-flash" 换成 model="deepseek-v4.1-flash-expires-on-0910",其余字段(base_urlapi_keymessages 格式)完全不变。

定价与 V4-Flash 一致:$0.25 / 百万输入 token,$1.00 / 百万输出 token。

但有两个硬限制:

  • 账户级并发上限 20 req/s,超限返回 HTTP 429,不可提升
  • 模型有效期至 2024 年 9 月 10 日,到期自动下线,无迁移路径

它本质是架构验证工具,不是长期服务选项。

👉 Binance · OKX · Gate.io · HTX · Bitget

行业意义:轻量多模态正从“能用”走向“敢用”

V4.1 Flash 不追求 SOTA 分数,而是第一次把原生多模态能力塞进 <30B 激活参数的推理框架,并把成本压到开发者敢批量调用的水平。

对比 Llama-3.2-11B-Vision(需 FP16 + ≥24GB 显存)或 Qwen2-VL-2B(无官方托管 API),它是目前唯一开箱即用、免部署、按量付费的轻量多模态 API。

对龙虾(yitb.com)生态用户尤其友好:OpenClaw Agent 框架 v0.8.3+ 已内置自动 fallback —— 检测到 image_url 字段时,自动路由至 V4.1 Flash,tool calling 逻辑无需改动。

开发者行动建议:今天就做三件事

  1. 立刻注册并申请内测权限:绑定 GitHub 账号,提交简短使用场景说明,审核通常 <2 小时
  2. 用真实业务流量跑一次 AB 测试:切 10% 生产请求到新模型,重点看 P95 延迟、图像解析准确率、错误率
  3. 检查并发瓶颈:如果当前应用峰值 >15 req/s,需提前在客户端加排队队列或降级策略——20 req/s 是硬天花板,不是配额

9 月 10 日后,DeepSeek 很可能发布正式版 V4.1(无日期后缀),但核心架构和能力边界已在此版中锁定。现在试,不是为了抢首发,而是为了在正式版上线前,摸清它的实际边界在哪里。


相关阅读

返回首页