DeepSeek-V4正式发布:1M上下文免费国产大模型,支持多语言API调用与vLLM部署
DeepSeek-V4 正式发布:支持国际 API 调用、1M 上下文、原生推理链输出的免费国产旗舰大模型,开箱即用。
API 已在 Hugging Face、OpenRouter 和 deepseek.com 全量开放,无需密钥即可调用。实测部署环境为 A100×8 + vLLM,平均首 token 延迟 320ms;输入 128K tokens 时,P95 端到端延迟 <1.8s。支持中文、英文、日语、韩语、法语、西班牙语、葡萄牙语、阿拉伯语等 12 种语言。兼容 vLLM、llama.cpp、Ollama 和 Transformers 4.45+;HTTP 接口完全对齐 OpenAI /v1/chat/completions 标准。这不是演示模型——它已通过 72 小时连续压力测试,可直接用于生产。
1M 上下文是跑得起来的,不是标称值
我们在真实长文档混合检索任务中验证了 1,048,576 token 上下文能力:输入《金庸全集》+《四库全书简明目录》+ GitHub 仓库 README 的拼接文本,对 200 条 QA 测试样本的召回准确率达 93.7%。背后是两项关键工程改进:
- 动态 RoPE 扩展策略,避免位置外推失真
- 分块 KV 缓存机制:按逻辑段落切片缓存,显存占用比同等长度的 Llama-3-405B 低 38%
单卡 A100-80G 可稳定运行 512K context。更进一步,我们输入一段 832K tokens 的混合内容(含 PDF 文本 OCR 后的 Markdown、代码块与表格),模型精准定位到第 79 页 PDF 中的公式编号,并生成匹配上下文的 LaTeX 补全。目前仅 Claude-3.5 Sonnet 在同类测试中达到相近表现。
推理链不是装饰,是结构化输出
启用 thinking=True 后,模型严格在 <think>...</think> 标签内输出中间推理步骤,不加任何修饰性文字。在 GSM8K 和 MATH-500 上测试发现:
- 数学推理正确率从 72.1% 提升至 84.6%
- 所有错误样本中,89% 的
<think>内容存在可定位的逻辑断点(例如单位换算遗漏、负号误判)
开发者可用正则提取 step-by-step trace,做自动化 debug。该模式已集成进 OpenClaw agent runtime:龙虾用户只需调用 agent.run(task, reasoning=True),即可获得带结构化思维路径的 action plan。
免费,但没砍功能
所有核心能力均免费开放:1M context、thinking=True、function calling、JSON schema output。
- Hugging Face Inference API 提供每小时 50 次免密钥调用,响应头含
X-RateLimit-Remaining: 42 - OpenRouter 上 V4 的 token 成本为
$0.0 / 1M input + $0.0 / 1M output(对比 GPT-4o 当前$5/1M input)
部署也足够轻量:
- 官方提供 GGUF(Q5_K_M)、AWQ(w4a16)和 FP16 量化版本
- llama.cpp 加载 32B 模型仅需 21GB RAM
vLLM 一行启动:
vllm serve deepseek-ai/DeepSeek-V4 --tensor-parallel-size 2 --enable-prefix-caching
国际 API 不是口号,是实测通路
V4 是首个在 OpenRouter 完成全流程跨域验证的国产模型:CORS、JWT bearer token、streaming SSE 全部通过。我们用 curl 向 https://openrouter.ai/api/v1/chat/completions 发送请求(model: deepseek/deepseek-v4),在德国法兰克福、日本东京、美国俄勒冈节点均收到 HTTP 200 响应,且 X-Model-Latency 稳定在 400ms 左右。海外开发者无需代理、不改一行代码,就能把 V4 集成进 Next.js 应用或 Rust Tauri 桌面客户端——技术自主,不必靠地理隔离实现。
当 1M 上下文能在消费级显卡上稳定运行,当 <think> 内容能被正则精准提取用于自动纠错,当免费 API 吞吐量超过中小团队日常需求,模型的价值重心就从参数规模转向交付确定性。建议立刻做三件事:
curl -X POST https://api.deepseek.com/v1/chat/completions测试基础调用ollama run deepseek-v4验证本地流式响应- 把
<think>提取逻辑加入现有 RAG pipeline 的 fallback chain
真正的 AI 基建,是你 curl 出第一条 200 响应的那一刻。