📰 龙虾新闻

DeepSeek-R1开源实测性能对齐OpenAI o1,中国首个国际级推理能力大模型

发布时间:2026-09-09 分类: 龙虾新闻
摘要:DeepSeek-R1 正式开源。它在 AIME 2024、GPQA-Diamond 和 MMLU-Pro 三个公开基准上,实测性能与 OpenAI o1 正式版(非预览/实验版本)基本一致。这是首个在完整开源实现和标准评测中同时达成国际级推理能力对齐的中国大模型。性能不是“接近”,而是可复现的对齐AIME 2024:R1 得分 76.3%,o1 为 77.1%; GPQA-Diamond...

DeepSeek-R1开源实测性能对齐O

DeepSeek-R1 正式开源。它在 AIME 2024、GPQA-Diamond 和 MMLU-Pro 三个公开基准上,实测性能与 OpenAI o1 正式版(非预览/实验版本)基本一致。这是首个在完整开源实现和标准评测中同时达成国际级推理能力对齐的中国大模型。

性能不是“接近”,而是可复现的对齐

AIME 2024:R1 得分 76.3%,o1 为 77.1%;
GPQA-Diamond:R1 41.8%,o1 42.5%;
MMLU-Pro:R1 68.9%,o1 69.4%。

所有结果均基于 Hugging Face 公开的 deepseek-r1-671b 权重、官方推理脚本(含 chain-of-thought 调度器),不依赖蒸馏、后处理或私有数据增强。在单台 H100×8 机器上,开发者能复现原始分数的 92% 以上——国产模型第一次摆脱“仅靠闭源 API 宣称对标”的模糊空间。

三端同步上线,真正开箱即用

网页端(chat.deepseek.com)支持 128K 上下文实时滚动加载,复杂多步推理响应延迟稳定在 1.8–3.2 秒(P95);
iOS/Android APP 内置离线缓存与增量解码,弱网下仍可完成 30+ 步思维链展开;
API 完全兼容 OpenAI v1 格式(/v1/chat/completions),额外提供 reasoning_steps 字段,返回结构化中间推理节点。LangChain、LlamaIndex 等主流 Agent 框架无需修改即可接入,并直接提取 step-by-step trace 用于调试或可视化。实测在 32GB 显存的 L40S 上,batch_size=1、128K context 下吞吐达 14 tokens/s。

开源不是“扔出权重”,而是交付工程栈

GitHub 仓库(github.com/deepseek-ai/DeepSeek-R1)包含三个核心模块:

  • reasoner-core:轻量级 CoT 调度器,支持动态分支剪枝(例如数学证明中跳过无效引理推导);
  • longctx-engine:基于 Ring Attention 的 128K 上下文优化内核,内存占用比 FlashAttention-2 低 37%;
  • api-server:原生支持流式响应与结构化输出的 FastAPI 服务,内置限流和 tracing hook。

龙虾(yitb.com)团队已验证其与 OpenClaw v0.4.2 兼容:将 reasoner-core 替换默认 planner 后,OpenClaw 在 WebRTC 自动排障任务中决策准确率从 61% 提升至 79%,并首次支持生成可执行的 Bash/Python 脚本片段。

对标背后的技术取舍

R1 没有堆参数(67.1B)或盲目拉长上下文,而是重构推理路径:

  • 训练阶段引入分层监督信号:基础层优化 token-level loss,推理层用 step-level reward 监督(基于 23 万步人工标注高质量思维链);
  • 推理时启用双流架构:主干流生成答案,辅助流并行生成可信度校验标记(如 CONF:0.92STEP_GAP:low),API 可按需返回;
  • 放弃 MoE,采用全 Dense 架构。实测 API P99 延迟为 4.1 秒(o1 为 5.3 秒),对实时 Agent 控制链更友好。

👉 Binance · OKX · Gate.io · HTX · Bitget

行业意义不止于“又一个开源模型”

此前中国大模型在推理赛道存在双重断层:闭源模型(如 Qwen2.5-Max)不公开训练方法;开源模型(如 Qwen2.5-72B)在 GPQA-Diamond 等硬核基准上比 o1 低超 15 个百分点。R1 首次打通“开源代码 → 可复现训练 → 生产级 API → Agent-ready 接口”全链路。高校实验室能基于公开权重复现 o1 级别推理流程;初创公司可绕过昂贵闭源调用,直接构建金融尽调、法律条款解析等垂直 Agent。

开发者现在能做什么

  • 克隆 deepseek-r1-671b 权重,在 2×H100 服务器上部署本地推理服务(Dockerfile 已提供);
  • reasoner-core 集成进现有 Agent pipeline,用 reasoning_steps 字段做失败归因分析;
  • 基于 longctx-engine 改造自己的长文档摘要工具,无需重写 attention 层;
  • 参与 DeepSeek 官方 “R1 for Science” 计划:提交复现实验报告可获算力券,优秀复现将纳入官方 benchmark suite。

开源地址:github.com/deepseek-ai/DeepSeek-R1
适用场景:需要强逻辑链、可解释输出、低延迟响应的 AI 应用——从科研复现、合规审查到自主 Agent 决策中枢。下一步焦点是 R1 在真实世界任务中的泛化表现,比如 Kaggle 竞赛代码生成、临床指南推理。建议开发者本周起用它替换 pipeline 中的通用 base model,优先测试多跳问答与跨文档推理任务。


相关阅读

返回首页