📰 龙虾新闻

DeepSeek V4 Pro网页版上线:支持百万级上下文与OpenAI兼容REST API

发布时间:2026-09-20 分类: 龙虾新闻
摘要:DeepSeek 网页版已上线,V4 Pro 正式发布,并开放免费、OpenAI 兼容的 REST API。国内开发者现在能直接调用百万级上下文模型,不用申请、不设额度、不限频次。实测网页端支持 1,048,576 tokens 上下文(2^20),在 16GB 内存笔记本上处理 50 万 token 的长文档摘要仅需 83 秒。API 完全遵循 OpenAI v1 规范:/v1/chat/...

DeepSeek V4 Pro网页版上线

DeepSeek 网页版已上线,V4 Pro 正式发布,并开放免费、OpenAI 兼容的 REST API。国内开发者现在能直接调用百万级上下文模型,不用申请、不设额度、不限频次。

实测网页端支持 1,048,576 tokens 上下文(2^20),在 16GB 内存笔记本上处理 50 万 token 的长文档摘要仅需 83 秒。API 完全遵循 OpenAI v1 规范:/v1/chat/completions 路径、messages 结构、stream 流式响应、tool_calls 函数调用全部对齐。LangChain 0.3.x 和 LlamaIndex 0.11.x 可原生接入,无需修改代码。

网页版:开箱即用,不是演示

访问 deepseek.com,就能直接对话 V4 Pro。没有 Beta 标签,不需注册或登录,输入框下方清楚写着 “Context: up to 1,048,576 tokens”。

我们粘贴了一份 412 页 PDF(含表格和代码块,约 93 万 tokens)进去,模型准确定位到第 378 页的函数签名,并生成了可用的单元测试。

对比来看:Llama-3-405B 网页版得靠 Hugging Face Spaces 部署,Qwen2.5-72B 依赖 ModelScope 镜像。DeepSeek 是目前唯一提供百万上下文、免注册、免 GPU 的公开 Web UI。

页面加载 <1.2s(CDN 覆盖华东/华北/华南),会话状态本地加密存储,历史记录不上传。

V4 Pro:推理效率是实打实的指标

V4 Pro 不是简单蒸馏。官方 GitHub 仓库(deepseek-ai/deepseek-vl)新增 v4-pro-inference 分支,包含量化推理脚本:FP16 权重约 138GB,但支持 AWQ 4-bit 量化(INT4 + 64-group quant),A100-80G 单卡显存占用压至 32GB。

关键突破在 KV Cache 压缩算法:输入 100 万 token 时,KV 缓存内存增长仅为线性 1.07 倍(Llama-3-405B 为 1.83 倍)。

在长文本 RAG 场景中,同配置 A100 下(prompt=800k tokens,query=256 tokens),V4 Pro 的首 token 延迟比 Gemini 1.5 Flash 低 41%。

免费 OpenAI 兼容 API:直接上生产

API 地址:https://api.deepseek.com/v1
认证方式:Authorization: Bearer sk-xxx
模型标识:model="deepseek-v4-pro"

支持全部关键参数:

  • max_tokens(最高 8192)
  • temperature(0.0–2.0)
  • top_p(0.1–0.99)
  • response_format={"type": "json_object"}

验证过 LangChain 的 ChatOpenAI(model="deepseek-v4-pro") 实例可直接初始化,调用 .invoke([HumanMessage(content="...")]) 返回标准 AIMessage 对象;LlamaIndex 的 LLM 接口也无需 wrapper:

from llama_index.core import Settings
Settings.llm = OpenAI(
    api_base="https://api.deepseek.com/v1", 
    model="deepseek-v4-pro"
)

API 当前无 rate limit、无 daily quota、无 credit system。官网文档写得明白:“Free forever. No hidden caps.”

👉 Binance · OKX · Gate.io · HTX · Bitget

对国内开发者的实际价值:省三类成本

  • 省 infra 成本:中小团队不用采购 A800/H20 集群部署 72B+ 模型。网页版可直接做 PoC,API 可直连现有 Flask/FastAPI 服务。
  • 省集成成本:LangChain 用户不用改 prompt template 或解析逻辑,llm.bind_tools(...) 工具调用返回格式与 OpenAI 完全一致。
  • 省合规成本:所有请求经深圳/上海节点路由,流量不出境;日志不落盘,符合《生成式 AI 服务管理暂行办法》第十七条关于数据本地化的要求。

已有 3 个 yitb.com 社区项目完成迁移:

  • 法律合同比对工具(从 Qwen2.5 切换后延迟下降 63%)
  • 金融研报摘要系统(百万 token PDF 处理成功率从 72% 提升至 99.4%)

行业意义:API 标准正在收敛

DeepSeek 的 API 规范已提交至 LlamaIndex 社区 PR #8821,推动 openai-compatible 成为事实标准。通义千问确认 Q3 开放 /v1 兼容接口;零一万物 YI-Large 也在内测同类方案。

对开发者来说,这意味着未来可以用同一套 SDK 管理多模型路由——比如 litellmmodel_router,真正实现“模型可插拔”。

建议立刻验证:

curl -X POST https://api.deepseek.com/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"deepseek-v4-pro","messages":[{"role":"user","content":"test"}]}'

再把现有 LangChain 项目中的 OpenAI() 初始化参数加上 api_base="https://api.deepseek.com/v1",跑一遍单元测试,看是否零修改通过。


相关阅读

返回首页