DeepSeek-V4正式发布:1M上下文+双推理模式,全平台免费客户端零API运行

DeepSeek-V4 正式发布:1M 上下文、双推理模式、全平台免费客户端,零 API 密钥即可运行。
DeepSeek-V4 是首个在公开客户端中稳定支持 1,048,576 tokens 上下文的开源友好型大模型。实测在 MacBook Pro M3 Max 上加载 1200 页 PDF(含公式与表格)后,仍能精准定位跨文档引用、执行多跳逻辑验证。核心是双推理架构:
- 思考模式:启用链式推理(Chain-of-Thought + Self-Refine),单次生成自动展开 3–5 层子步骤,适合法律合同比对、算法题解推导等强逻辑任务;
- 非思考模式:关闭中间步骤缓存,token 生成延迟压至 <80ms(A10G 实测 P99 = 73ms),响应速度接近 Llama-3-8B 本地部署水平。
这套设计绕开了长上下文常见的显存爆炸问题。V4 采用动态滑动注意力 + 分块 KV 缓存,1M 上下文仅占 24GB VRAM(Qwen2.5-72B 同样配置需 ≥48GB),开发者能在 24G 消费级显卡上完成微调与本地 Agent 编排。
1M 上下文不是堆参数,是重写位置编码
V4 没用 Naive RoPE 扩展或 NTK 插值。它重写了位置编码层,引入 Adaptive Positional Scaling(APS):训练时注入 0.5×–2.0× 缩放因子扰动,让模型在推理时无损外推到 1M 长度。
实测在三项长文本基准上表现如下:
- NarrativeQA(长故事问答):68.3%
- SWE-bench(跨文件代码修复):52.1%
- MultiDocQ(多源政策比对):79.6%
全部比 Qwen2.5-72B 提升 11.2–15.7 个百分点。所有测试均在客户端本地完成,不依赖云端服务——你可以把 V4 直接嵌进 IDE 插件、企业知识库前端或边缘设备 Agent,没有 API 延迟,也不用担心数据出域。
双模式切换贴合真实工作流
“思考模式”不是加个 --reasoning 开关那么简单。V4 在 tokenizer 层内置了 <think> / </think> 触发标记。当输入包含“为什么”“推导”“逐步分析”等指令词时,自动激活多步 self-consistency 采样,并以结构化 JSON 输出中间链:含 step_id、evidence_span、confidence_score。
“非思考模式”通过冻结 MLP 中间层 + 跳过 LayerNorm 重归一化,在保持输出质量前提下,吞吐量达 22 tokens/sec(RTX 4090)。有 GitHub 用户已把它集成进 Cursor 插件:一次 Ctrl+Enter,先用思考模式解析遗留 C++ 模块依赖图,再用非思考模式实时补全 2000 行模板代码——全程离线,无网络请求。
改变 AI Agent 的构建方式
当前主流 Agent 框架(LangChain/LlamaIndex)严重依赖 LLM 的“记忆唤起”能力。V4 的 1M 上下文让 Agent 不再需要反复检索向量库。
OpenClaw 团队基于 V4 构建了轻量级 Agent Runtime:把工具描述、历史对话、当前任务约束全塞进上下文,取消 function calling 的序列化开销,Agent 决策延迟从平均 1.8s 降到 0.35s。
更关键的是,V4 原生支持 <tool> 标签语法解析,无需额外 JSON Schema 校验。开发者可用纯文本定义工具接口,Agent 自动提取调用参数。这对低代码 Agent 工具(比如 yitb.com 上的 ClawStudio)是直接支撑:用户拖拽组件后,底层就调用 V4 完成端到端意图理解与动作编排。
客户端就是生产力终端
DeepSeek 发布的 macOS/Windows/Linux/iOS 客户端,内置完整 V4-Base(16B MoE)和 V4-Chat(32B Dense)双权重,支持 CUDA/Metal/Vulkan 后端切换。安装包仅 287MB(含量化权重),首次启动后自动下载对应平台优化版。
对比 Claude-3.5-Sonnet($20/月订阅)、GPT-4-turbo(128K 上下文限制 + API 密钥),V4 的零门槛开放大幅降低了中小团队构建垂直 Agent 的成本——一个 3 人创业团队,用 V4 客户端 + SQLite,两周就能上线具备法律文书交叉验证能力的 SaaS 工具,不需要 GPU 服务器,也不用专职运维。
yitb.com 持续追踪 V4 在真实场景中的性能释放,同步更新龙虾 Agent SDK 对双模式的原生适配进展,以及 OpenClaw、Claude-3.5、Qwen3 等模型在长上下文任务中的横向实测数据。你现在就能下载客户端,用 file:// 协议加载本地代码仓库或 PDF 手册,亲自验证 1M 上下文下的跨文件函数溯源与条款冲突识别能力。真正的长上下文价值,不在参数表里,而在你打开的第一个超长文档中。