📰 龙虾新闻

DeepSeek-V4.1-Flash原生多模态大模型发布:中文强推理+视觉输入,推理提速40%、API成本降35%

发布时间:2026-09-15 分类: 龙虾新闻
摘要:DeepSeek-V4.1-Flash正式发布:原生多模态中文大模型,推理快40%,API成本降35%,支持视觉输入与中文强推理,已开放标准OpenAI兼容接口。架构不是微调,是重做V4.1-Flash和V4没有参数继承关系。它基于非对称混合架构(Asymmetric Hybrid Architecture)从头训练:文本编码器和视觉编码器完全独立,各自调度参数。文本侧用优化后的RoPE-2...

DeepSeek-V4.1-Flash原

DeepSeek-V4.1-Flash正式发布:原生多模态中文大模型,推理快40%,API成本降35%,支持视觉输入与中文强推理,已开放标准OpenAI兼容接口。

架构不是微调,是重做

V4.1-Flash和V4没有参数继承关系。它基于非对称混合架构(Asymmetric Hybrid Architecture)从头训练:文本编码器和视觉编码器完全独立,各自调度参数。文本侧用优化后的RoPE-2D位置编码和动态NTK缩放;视觉侧接入轻量ViT-L/14变体(patch size 14×14,最大分辨率1024×1024),不复用CLIP权重,也不依赖LLM后置投射头。两者在中间层通过跨模态门控注意力(CMGA)融合。

实测数据(A100-80G单卡,batch_size=1):

  • 输入1280×720图像 + 300字中文query,端到端延迟892ms(V4为1486ms)
  • 吞吐量17.3 req/s,提升40.1%(±1.2%,n=5000)

Token计费逻辑彻底改写

V4.1-Flash不再按固定patch数量计费图像token。它采用语义密度感知分块(Semantic-Density Chunking):图像被自动划分为高/中/低信息区域,只对前60%高熵区域进行编码,其余部分由上下文插值重建。

效果:

  • DocVQA、MMBench-CN等中文文档理解任务中,同等准确率下视觉token减少52%
  • 文本侧配合FP8量化KV Cache + 滑动窗口截断
  • 综合API调用成本下降35.2%(按DeepSeek 2024 Q3官方定价测算,含图像输入场景)
  • 示例:日均10万次图文问答,月成本从¥28,600降至¥18,500

中文强推理,有数据、有闭环、有边界

“中文强推理”不是泛泛而谈:

  1. C-Eval全量得分78.4(V4为72.1),数学子集(Gaokao-Math、CMMLU-Math)+9.6分
  2. LongChain-CN自建基准准确率63.8%:覆盖嵌套因果链、多跳法律条款引用,比GPT-4o中文版高5.2个百分点
  3. 原生128K上下文滑动,无chunking truncation:处理103页PDF合同(含表格、印章、手写批注)时,关键条款召回率99.1%,错误归因率<0.4%

所有训练数据100%来自中文互联网、学术论文、政务公开文件及OCR清洗后的扫描件,未混入任何英文翻译语料。

👉 Binance · OKX · Gate.io · HTX · Bitget

开发者今天就能用

V4.1-Flash已上线DeepSeek API,完全兼容OpenAI格式:

POST /v1/chat/completions

视觉输入走content数组中的image_url字段(支持base64或公网URL),无需额外SDK或客户端更新。

真实用例:

  • yitb.com实测:同一段Cursor插件代码,仅把model="deepseek-vl"换成"deepseek-v4.1-flash",PDF解析P95延迟从2.1s降至1.2s,token用量↓37%
  • 在龙虾(yitb.com/l/lobster)Agent工作流中接入后,多步文档比对任务成功率从81%升至94%,首次失败重试率↓62%

模型权重未开源,但提供LoRA微调接口,支持Qwen2/VL适配器热加载。

输入输出定义清晰,不是Demo

官方明确支持三类输入组合:

  • 纯文本
  • 文本 + 单图
  • 文本 + 多图(最多4张,模型自动排序上下文优先级)

输出严格遵循中文表达习惯:

  • 不混用中英术语(例如输出“检索增强生成流程”,而非“RAG pipeline”)
  • 数学表达式默认渲染为LaTeX
  • 法律/医疗类回答附带依据标注(如“依据《民法典》第584条”)

ONNX Runtime优化版本已在HuggingFace Model Hub上线:
deepseek-ai/deepseek-v4.1-flash-onnx
Windows本地可跑:RTX 4090 + 32GB RAM 支持 1024×768 图像 + 512 文本 tokens


相关阅读

返回首页