📰 龙虾新闻

DeepSeek-V4正式发布:支持1M上下文与原生双模推理的国产大模型

发布时间:2026-07-26 分类: 龙虾新闻
摘要:DeepSeek-V4 正式发布:首个支持 1M 上下文、原生双模推理的国产大模型,客户端全平台免费可用,本地调用零配置。V4 不是参数堆砌的升级,而是推理方式的重构。它把“思考模式”(Chain-of-Thought, CoT)和“非思考模式”(Direct Output)直接嵌入模型架构——不需要写 prompt 提示词,也不依赖后端路由调度。模型根据输入复杂度自动决定是否展开思维链。实...

封面

DeepSeek-V4 正式发布:首个支持 1M 上下文、原生双模推理的国产大模型,客户端全平台免费可用,本地调用零配置。

V4 不是参数堆砌的升级,而是推理方式的重构。它把“思考模式”(Chain-of-Thought, CoT)和“非思考模式”(Direct Output)直接嵌入模型架构——不需要写 prompt 提示词,也不依赖后端路由调度。模型根据输入复杂度自动决定是否展开思维链。实测中:

  • 代码补全任务,上下文超 30 万 token 时,函数签名还原准确率达 92.7%(V3 同条件下下降 14.3%)
  • 处理 127 页 PDF 技术白皮书后,跨章节逻辑问答延迟稳定在 820ms 内(RTX 4090 本地部署)
  • 1M 上下文不是理论值:RAG 场景下,传统分块+检索+重排序流程被跳过;单次注入整本《Linux 内核源码剖析》(892MB 纯文本),可直接定位模块级缺陷;长文档摘要能保留嵌套表格结构与脚注引用关系

免费客户端 ≠ 削减功能,而是重新定义“开箱即用”

V4 客户端不依赖云端 API 密钥,不限用量,不设订阅门槛:

  • Web 端用 WebAssembly 编译推理核心,加载后完全离线运行
  • 桌面端(Windows/macOS/Linux)采用 INT4 量化权重 + 内存映射加载,56GB RAM 笔记本可完整加载 1M 上下文
  • iOS/Android App 内置轻量 Tokenizer 和动态 KV 缓存管理器,iPhone 15 Pro 在未插电状态下连续处理 42 页含公式的 LaTeX 论文,耗电仅 11%

关键突破是本地调用零成本:无需配置 CUDA、不用 conda 虚拟环境、不必手动下载 GGUF。安装包自带自适应推理后端(自动探测 Metal/Vulkan/CUDA),双击启动。开发者反馈,用 V4 替代 Llama-3-70B 做本地代码库分析,硬件门槛从 A100×2 降到 RTX 4070 单卡,推理吞吐提升 3.2 倍。

双模推理怎么改工作流?

  • “思考模式”下,模型显式输出中间推导步骤(比如数学证明的引理拆解、SQL 生成的表连接路径),每步都可按 token 回溯——调试时能准确定位哪一步逻辑断裂
  • “非思考模式”关闭所有中间状态缓存,压缩输出,响应快 40%,适合 API 代理、实时对话、CLI 命令生成等低延迟场景

两种模式不是全局开关,而是 token 粒度决策:同一请求里,“解释量子退火原理”走 CoT,“用 Python 实现 QAOA 电路”切 Direct 模式。这种混合策略已在龙虾(yitb.com)OpenClaw v0.8.3 测试分支落地,支持 /think off 指令强制禁用思维链,验证底层一致性。

长上下文不是为了跑分,而是解决真实问题

当前 RAG 系统平均把文档切成 512-token 分块,再经历 embedding → 相似度检索 → 重排序三阶段,噪声累积、上下文割裂不可避免。V4 的 1M 原生支持让整份企业知识库一次性注入成为现实——包括 Confluence 导出 HTML、Notion 数据库快照、Git 提交历史。

某自动驾驶公司实测:将 23 个 ROS2 包的 C++ 源码(预处理为纯文本,总计 1.2TB)注入 V4,模型直接识别出 /sensors/camera_node/control/planner 之间未声明的隐式时序依赖,并定位到 commit a7f3d1e 中被注释掉的关键锁机制——此前需人工审计 3 人周。

文档理解方面,V4 对带页眉页脚、多栏排版、PDF 扫描件 OCR 噪点的混合文本,实体抽取 F1 达 0.89(Llama-3-70B 为 0.71)。核心在于其位置感知 Attention 机制支持跨页坐标建模。

API 暂不开放:优先保障终端体验

V4 官方 API 接口暂未开放,入口仍在灰度测试。这不是技术封锁,而是资源分配选择:全部算力优先用于打磨客户端稳定性与本地兼容性。开发者暂时无法将其接入自有服务编排链路,但能立刻获得 AGI 级交互能力——教育机构、开源项目维护者、独立开发者直接受益。

龙虾社区已上线 V4 客户端校验工具(yitb.com/deepseek-v4-check),支持上传任意文本片段,返回实际占用上下文窗口大小与模式切换日志,避免“标称 1M、实测崩塌”。

AI 正在从“模型即服务”转向“模型即终端”。V4 把 AGI 能力塞进浏览器标签页、放进手机 App、跑在开发者的旧笔记本上。当 1M 上下文不再是数据中心的特权,当双模推理成为默认行为而非高级选项,AI 平民化才真正落地。

建议:

  • 开发者:立刻下载客户端,用真实代码库或技术文档压测
  • 研究者:关注其双模切换的 token 级决策机制
  • 企业用户:评估用 V4 替代现有 RAG pipeline 后的 TCO 下降曲线——别等 API,现在就能用
返回首页