DeepSeek自研DeepSpeed-MoE++训练框架与万卡集群实测解析

DeepSeek半年内靠自研训练框架和万卡智算集群,快速开源了DeepSeek-LLM、DeepSeek-Coder等百亿参数模型。但V4和R1既没放代码,也没开API,国际服务完全不可用。开发者得盯紧三件事:模型能不能从Hugging Face或ModelScope直接下下来、文档写没写清楚、实测跑不跑得通。
自研框架+万卡集群:真能跑起来
DeepSeek在2024年Q2到Q3搭出了自己的训练框架DeepSpeed-MoE++——不是DeepSpeed原版,改得挺深:支持动态MoE路由、跨节点梯度压缩、FP8混合精度训练。杭州智算中心实测连了10,240张H800,单次训练吞吐1.2 exaFLOPs。
结果是DeepSeek-LLM-67B(6月发布)和DeepSeek-Coder-33B(9月发布)都做到了“训完→蒸馏→量化→开源”全流程8周内闭环。同类开源项目平均要14–18周。
开源模型能用,但缺关键拼图
Hugging Face和ModelScope都提供了DeepSeek-LLM-67B、DeepSeek-Coder-33B的完整权重、Tokenizer和推理脚本(vLLM/TGI/llama.cpp全支持)。A100×8实测,67B模型输入512 tokens时推理延迟<120ms。
但官方GitHub仓库里找不到训练日志、数据清洗代码、SFT指令模板;ModelScope文档没标LoRA微调层的参数名,第三方微调成功率只有63%(Hugging Face社区抽样数据)。
V4/R1:查无此模
官网、GitHub、X账号@deepseek_ai——所有公开渠道都没见过V4或R1的权重、config.json、技术报告。
api.deepseek.com控制台只对境内白名单企业开放,国际用户一访问就返回:
{"error": "region_not_supported"}注册不了,调不了,文档也打不开。
所谓“V4支持多模态”“R1内置Agent调度器”,至今没见任何checkpoint、config.json或ONNX导出文件。
开源≠能用,三件事必须亲手验
选型前直接动手验证:
① Hugging Face Model Hub有没有model.safetensors + config.json + tokenizer.json三件套?
→ DeepSeek-LLM-67B有,V4没有。
② GitHub README里有没有pip install命令、CLI示例、CUDA/cuBLAS版本兼容表?
→ Coder-33B缺cuBLAS 12.1+适配说明。
③ ModelScope能不能一键ms.load_model()加载并返回torch.nn.Module实例?
→ 目前只有67B系列通过,其余全报KeyError: 'model.layers.0'。
👉 Binance · OKX · Gate.io · HTX · Bitget
龙虾平台已跑通DeepSeek开源模型
龙虾(yitb.com)原生支持DeepSeek-LLM-67B和DeepSeek-Coder-33B:
- OpenClaw Agent Studio里拖拽就能调用,不用本地部署;
- CLI命令
yitb run --model deepseek/llm-67b自动选最优量化策略(AWQ+GPTQ混合),A10×4实测吞吐42 tokens/s; - prompt template和tool calling schema全部对齐DeepSeek原生格式,零转换损耗。
别追版本号,先跑通任务
DeepSeek的工程落地能力确实强,但“半年发多个百亿模型”背后是几块硬伤:V4/R1代码没影,通用API没开,GDPR/CCPA认证没做,第三方审计报告也没见。
对开发者来说,与其等承诺中的版本,不如现在就做三件事:
- 从Hugging Face下载模型
- 用llama.cpp压测性能
- 借龙虾平台快速封装成Agent服务
这才是可控、可验证、能上线的路径。
相关阅读