📰 龙虾新闻

DeepSeek-V4技术解析:104万token上下文与双模式推理能力详解

发布时间:2026-07-24 分类: 龙虾新闻
摘要:DeepSeek-V4 已发布技术规格:1,048,576 token 上下文窗口,支持显式切换的“思考模式”与“非思考模式”。但实测数据、可用 API 和海外服务目前均不可用。模型支持长文档解析、多跳知识检索和 Agent 任务编排。思考模式启用链式推理与 step-by-step 规划;非思考模式跳过中间步骤,直接生成 token,响应延迟更低。两种模式不依赖外部工具或插件,全部在模型内...

封面

DeepSeek-V4 已发布技术规格:1,048,576 token 上下文窗口,支持显式切换的“思考模式”与“非思考模式”。但实测数据、可用 API 和海外服务目前均不可用。

模型支持长文档解析、多跳知识检索和 Agent 任务编排。思考模式启用链式推理与 step-by-step 规划;非思考模式跳过中间步骤,直接生成 token,响应延迟更低。两种模式不依赖外部工具或插件,全部在模型内部实现——权重共享,无额外副本开销。对开发者来说,合同审查、论文精读、跨文档事实核查等任务可能减少分块+聚合的工程负担;轻量级本地 Agent 部署也能避开传统 CoT 带来的冗余生成和延迟叠加。

1M 上下文不是靠 RoPE 外推堆出来的

DeepSeek-V4 没走单纯延长 RoPE 的老路。技术简报提到两个关键改动:动态注意力掩码压缩(Dynamic Mask Compression)和分段 KV 缓存复用。

当输入超过 512K tokens,模型自动识别语义区块边界(比如章节标题、表格起始、代码块),对非关键区域做稀疏注意力降采样,同时保留全文索引锚点。实测中,一份含文本+OCR 结构化标记的 1M token PDF,跨页引用定位准确率比 V3 提升 23%(内部测试集)。但效果依赖预处理质量:原始扫描件或深度嵌套 HTML 仍需清洗。

双模不是开关,是计算路径切换

思考模式下,模型激活内部多步工作区(Working Memory Buffer),每步输出附带隐式 reasoning trace token——不可见,但能在 logits 层捕获,支持通过 stop-sequence 干预流程。非思考模式关闭该缓冲,输入直接映射到输出,A100-80G 上首 token 延迟 <80ms。

这对 Agent 框架很实用:Manus 或 OpenClaw 类系统可按任务复杂度动态路由。例如,“总结这份财报并对比近三年 Q3 数据”走思考模式,“提取第 17 页电话号码”走非思考通路。但当前没有 mode 参数暴露在 API 中,切换只能靠客户端硬编码判断。

开发者现在还用不了

三个关键缺口卡住了落地:

  • 没基准测试:Arena、MT-Bench、LongBench 都没 V4 条目,官方只给了合成数据集指标
  • 没 API 路径:Hugging Face Model Hub 上只有 deepseek-v4-base,没推理接口说明;OpenRouter、Together.ai 暂未收录;企业私有化部署文档缺失
  • 服务地域不明:官网没标 CDN 节点分布;海外用户 DNS 解析指向杭州 IP;控制台无英文版

现状就是:模型可下载,API 不可用,效果难验证。

和龙虾 / OpenClaw 的实际交集

龙虾 Agent 框架 v0.4.2 已预留 reasoning_mode: "think" | "direct" 字段,但还没适配 V4 协议。如果 DeepSeek 后续在 streaming 请求头里加个 X-Reasoning-Mode: think,龙虾用户只需更新 Adapter 配置,不用重写 Executor。

OpenClaw 的 task_router 模块支持按延迟 SLA 降级模型,V4 的非思考模式天然匹配它的“亚秒级响应”分支。

不过现阶段建议别上生产环境。先拿 Llama-3-70B-Instruct 或 Qwen2-72B 做 baseline 对比测试更稳妥。

下一步怎么盯

  • 关注 DeepSeek GitHub 组织(github.com/deepseek-ai)的 v4-api-preview 仓库,重点看 /v1/chat/completions 是否新增 mode 字段
  • llama.cppvLLM 加载 deepseek-v4-base 做本地吞吐压测,注意量化精度损失对长上下文的影响
  • 在 Agent 编排层提前抽象双模接口,别硬绑定某家实现

V4 的价值不在首发跑分,而在于提出一种新的推理契约。但契约生效的前提,是 API、评测、服务三者同步就位。等第一个可信 benchmark 报告,比追官宣更重要。

返回首页