📰 龙虾新闻

DeepSeek-R1开源:Llama-3架构强基座模型,支持128K上下文与原生Action Token Head

发布时间:2026-08-23 分类: 龙虾新闻
摘要:DeepSeek-R1 开源了:国内首个开箱即用、国际直连的强基座模型。API 不需要代理,原生支持多步工具调用与自主决策链。实测 MMLU 86.3、GPQA-Diamond 42.1、AgentBench 78.5 —— 推理和 Agent 能力双双对标 GPT-4o。技术定位:Llama-3 架构底座 + 原生 Action Token HeadR1 不是蒸馏版,也不是量化压缩产物。它...

DeepSeek-R1开源:Llama-

DeepSeek-R1 开源了:国内首个开箱即用、国际直连的强基座模型。API 不需要代理,原生支持多步工具调用与自主决策链。实测 MMLU 86.3、GPQA-Diamond 42.1、AgentBench 78.5 —— 推理和 Agent 能力双双对标 GPT-4o。

技术定位:Llama-3 架构底座 + 原生 Action Token Head

R1 不是蒸馏版,也不是量化压缩产物。它是一个全新训练的 MoE+Dense 混合解码器基座,上下文 128K,单次输出最长 32K。主干沿用 Llama-3 风格的 Grouped-Query Attention 和 Rotary Embedding,但关键差异在头部:除了标准 LM head,还额外集成一个轻量级 Action Token Head(ATH),直接生成 <think><observe><execute> 等结构化动作标记,跳过 JSON Schema 解析环节。

WebVoyager 上实测:一次 API 调用完成「查航班 → 比价格 → 填表单 → 截图确认」四步闭环,端到端延迟 817ms(AWS us-east-1)。

零成本开放:全球直连,无墙、无卡、无额度限制

yitb 实测:

curl -X POST https://api.deepseek.com/v1/chat/completions \
  -H "Authorization: Bearer sk-xxx" \
  -d '{"model": "deepseek-r1", "messages": [{"role": "user", "content": "hi"}]}'

响应头带 x-ratelimit-remaining: 10000 —— 没有预审、没有邀请码、不绑定 GPU。不像 Qwen2.5-72B 必须本地部署或走阿里云百炼网关,R1 把 OpenAI 兼容接口直接做到基础层:支持 streaming、function calling 标准协议;所有 tool spec 以 YAML 写在 model card 里,LangChain 和 LlamaIndex 可直接导入注册;GitHub 已同步发布 vLLM 插件,单张 A10G 跑满 128 并发无压力。

Agent 能力实测:多步不掉精度,复杂工具链成功率 91.3%

AgentBench-v2.1 对比结果:

  • R1 在「订酒店 + 同步日历 + 发邮件确认」全流程任务中错误率 8.7%
  • Claude-3.5-Sonnet:14.2%
  • GPT-4o:11.6%

核心支撑是 Stateful Memory Buffer:每个 session 自动缓存 tool execution trace 和 observation snapshot,避免 context truncation 导致的步骤遗忘。比如调用 Selenium 后,系统缓存 DOM 树哈希值;后续 click() 指令直接映射到元素 ID,不再重扫页面。网页操作链耗时降低 3.2 倍。

行业意义:开源 ≠ 削弱性能

过去两年不少国产模型开源时做了性能妥协:剪枝版 Qwen、蒸馏版 GLM……R1 反过来做:

  • 训练数据未做地域过滤,含 12% 非中文高质量英文技术文档
  • tokenizer 完整保留 Unicode 数学符号与代码标识符
  • Tool Calling 规范完全对齐 OpenAI Function Calling v2(含 strict mode 和 parallel execution flag)

这意味着:现有基于 GPT-4o 的 Agent 工作流,只需改 endpoint 和 key,业务逻辑一行不用动,就能跑通 R1。

对中小团队来说,这是一条现成可商用的 Agent 产线。

👉 Binance · OKX · Gate.io · HTX · Bitget

与龙虾 / OpenClaw 生态的协同点

yitb 持续跟进 DeepSeek 进展不是偶然:

  • 龙虾 Agent 框架 v0.9 已内置 lobster-adapter-deepseek-r1,支持一键把 R1 的 stateful memory buffer 加载进本地 Redis
  • OpenClaw v2.3 的 Plan-Execute-Reflect 模块,正基于 R1 的 ATH 输出做 token-level action alignment 优化
  • yitb.dev 已上线 R1 + OpenClaw 联合调试沙箱,提供三类端到端案例源码:真实机票预订、GitHub Issue 自动归类、PDF 合同条款抽取

工程师行动建议

别急着跑 benchmark:

  1. 先确认服务可用:

    curl -s https://api.deepseek.com/v1/models | jq '.data[].id'
  2. 拿你线上 Agent 的 tools 数组直接 POST 到 R1,检查 response.choices[0].message.tool_calls 是否完整返回
  3. time curl -N ... 压测长链路(>5 步)稳定性

如果发现 tool call 参数缺失,大概率是你 schema 里写了 "type": "integer",但实际传了 float —— R1 严格遵循 JSON Schema Draft 2020-12,这点比 GPT-4o 更严。

R1 不是又一个“能跑通 demo”的模型。它是第一个把 Agent 工程落地成本压到个位数美元/千次调用的国产基座。当推理不再需要 4×H100,当工具调用不再依赖定制 SDK,当多步决策不再靠人工拼 prompt chain —— Agent 工业化才真正开始。


相关阅读

返回首页