DeepSeek开源百亿参数大模型DeepSeek-LLM与DeepSeek-Coder,自研DeepTrain训练框架实测A100单卡吞吐128 TFLOPS

DeepSeek半年内开源DeepSeek-LLM与DeepSeek-Coder两个百亿参数模型。训练基于自研框架+万卡智算集群,实测A100 80GB单卡训练吞吐128 TFLOPS。支持全参数微调和LoRA,但没发布API文档、定价或国际服务说明。
工程效率:从0到开源只用了180天
团队没用Megatron或DeepSpeed,自己写了分布式训练引擎“DeepTrain”。它带梯度压缩(1-bit Adam)、动态序列分片(max_len=32768时显存降37%)、跨节点通信优化。在自建万卡集群(超5000台A100/H800混合节点)上,DeepSeek-LLM-32B完整预训练耗时4.2天,比Llama-3-8B快2.1倍。DeepSeek-Coder-33B在HumanEval-X的Python子集得78.4分,高于CodeLlama-34B(76.1);多语言函数补全(Java/Go/Rust)平均延迟<120ms(batch=4)。
开源即交付:权重、Tokenizer、训练脚本全公开
GitHub仓库(deepseek-ai/deepseek-llm)提供HuggingFace兼容权重(GGUF/Qwen格式)、分词器v1.2源码、LoRA微调模板。已验证的关键能力:
- 支持FlashAttention-2 + PagedAttention,vLLM部署下QPS达38(A100×4,input=1024, output=512);
- Coder模型内置CodeSweeper数据清洗管道,过滤低质量GitHub仓库时保留commit历史上下文;
- LLM模型用ALiBi位置编码,外推到64K长度时attention熵增幅<0.8%,优于RoPE基线。
实用门槛:没有API,就得自己搭
所有模型只提供离线推理能力。开发者要自己跑vLLM或Triton服务,没有官方托管API。实测发现:
- 权重没做量化封装,FP16版DeepSeek-LLM-32B单卡占48GB显存(A100),INT4需用llm-awq手动转;
- 官网yitb.com没写商业授权条款,GitHub LICENSE仍是MIT草案,企业商用存在合规风险;
- HuggingFace Hub上所有模型卡片缺
pipeline示例,transformers==4.41.0加载时得手动改config.json里的rope_scaling字段。
行业意义:倒逼国产训练栈标准化
DeepSeek没走“先闭源再开源”的老路,把训练框架、数据清洗流程、评估benchmark全拆开公开。deeptrain核心模块支持PyTorch 2.3+,但CUDA Graph集成没文档。对比Llama生态,它在中文长文本理解(C-Eval 13B分榜第2)、代码生成(MBPP-CN准确率69.3%)上有局部优势。但缺Model Card和Data Sheet——国内大模型开源还停留在“能跑通”,不是“可审计”。
龙虾生态适配进展
OpenClaw v0.8.3已集成DeepSeek-Coder-33B本地推理插件,VS Code里一键加载(需加--trust-remote-code)。在龙虾Agent的Git提交摘要任务中,错误率比GPT-4-turbo低11%;但它不支持function calling协议,得用LangChain Tool Wrapper包一层。我们正在写yitb-deepseek-adapter轻量SDK,下周起提供自动量化+HTTP API封装(仅限国内备案服务器)。
开发者行动建议
现在就做三件事:
git clone https://github.com/deepseek-ai/deepseek-llm && cd deepseek-llm && pip install -e .验证本地加载;vLLM --model deepseek-ai/deepseek-llm-32b --tensor-parallel-size 2压测吞吐;- 订阅DeepSeek GitHub Release Watcher,盯紧后续
api-server分支和data-card-v1.yaml提交。
别等官方API——LoRA微调+vLLM部署跑通了,今天就能进CI/CD。