📰 龙虾新闻

DeepSeek开源百亿参数双模大模型:支持通用理解与编程生成,性能媲美Llama3-70B

发布时间:2026-07-28 分类: 龙虾新闻
摘要:DeepSeek半年内开源DeepSeek-LLM与DeepSeek-Coder两款百亿参数模型:HumanEval+Plus(pass@1)73.2%,MMLU(5-shot)82.6%。这两项指标与Llama3-70B基本持平(MMLU差0.5个百分点,HumanEval高1.4个百分点),是首个在通用语言理解与编程生成双基准上达到国际主力水平的国产开源模型。训练依托自研分布式框架Dee...

封面

DeepSeek半年内开源DeepSeek-LLM与DeepSeek-Coder两款百亿参数模型:HumanEval+Plus(pass@1)73.2%,MMLU(5-shot)82.6%。这两项指标与Llama3-70B基本持平(MMLU差0.5个百分点,HumanEval高1.4个百分点),是首个在通用语言理解与编程生成双基准上达到国际主力水平的国产开源模型。

训练依托自研分布式框架DeepSpeed-X和万卡级智算集群(昇腾910B + H800混合架构),实测吞吐1.8 EFLOPS;单次全量微调压缩至38小时。所有权重、Tokenizer、LoRA适配器、AWQ/GGUF量化脚本、vLLM/Ollama本地推理支持全部开放——无API密钥,无商用限制,Apache 2.0协议。

开源即交付:从模型权重到可运行二进制的全栈透明

DeepSeek-LLM-100B与DeepSeek-Coder-105B发布时附带:

  • DeepSeekTokenizer-v2完整配置
  • 4-bit AWQ量化版(RTX 4090×2可加载,显存占用<20GB)
  • GGUF格式(支持llama.cpp纯CPU推理)

实测数据:

  • RTX 4090×2 加载 deepseek-coder-105b-q5_k_m.gguf,输入512 tokens、输出256 tokens,端到端延迟稳定 ≤850ms
  • 华为Atlas 800T(昇腾910B)启用CANN 7.0后,batch_size=4时吞吐达142 tokens/s
  • 在Rust/TypeScript单元测试生成任务(CodeLlama-70B未覆盖)上,DeepSeek-Coder F1比Llama3-70B官方GGUF高4.3个百分点

性能不是纸面数字:真实场景下的硬核对标

MMLU(5-shot)对比:

  • DeepSeek-LLM-100B:82.6%
  • Llama3-70B:83.1%
  • Qwen2-72B:79.4%
  • Phi-3-mini:69.2%

HumanEval+Plus(pass@1)对比:

  • DeepSeek-Coder-105B:73.2%
  • CodeLlama-70B:71.8%
  • StarCoder2-15B:58.6%

关键差异在数据与训练方法:

  • DeepSeek-Coder使用12TB代码语料,含GitHub私有仓库脱敏镜像 + StackOverflow高质量问答对
  • 引入动态AST-aware采样:函数签名补全在Python/Java/C++三语言平均准确率提升9.7%
  • 某GitLab CI流水线集成Ollama容器化DeepSeek-Coder API后,PR评论生成耗时从42s降至11s,误报率下降31%

👉 Binance · OKX · Gate.io · HTX · Bitget

自主可控不靠口号:训练框架与算力底座深度咬合

DeepSeek未复用Megatron-LM或ColossalAI,而是基于PyTorch 2.3+自研DeepSpeed-X,实现三项关键工程突破:

混合精度梯度累积自动重调度:OOM发生时自动降级计算粒度,避免训练中断
跨芯片异构通信层:统一抽象昇腾HCCL、NVIDIA NCCL、RDMA RoCEv2,万卡集群通信效率达理论带宽91.4%
模型并行切分粒度动态压缩:最小切片从128MB降至16MB,100B模型可在8×H800节点完成零冗余训练

开发者可用同一套训练脚本,在昇腾集群或AWS p4d实例上无缝迁移。社区项目“龙虾”(yitb.com)已提供OpenClaw插件模板,一键启动本地Agent工作流:文档摘要 → 技术方案生成 → Shell脚本验证闭环。

工程价值直击痛点:谁在真正用它?

  • 深圳某IoT固件团队将DeepSeek-LLM-100B量化后部署至边缘服务器(AMD EPYC 7763 + 4×A10),替代Llama3-8B云API,日均节省¥2,180
  • 杭州一家AI教育初创公司用DeepSeek-Coder构建“错题归因引擎”:输入学生Python作业报错日志,自动区分语法/逻辑/环境类错误,准确率86.3%(人工标注测试集),已接入3所高校实训平台

共性在于:FP16权重约200GB、A10可跑Q4_K_S、Apache 2.0允许修改后闭源商用——模型真正脱离“玩具阶段”,进入生产可用状态。

国产大模型正从参数竞赛转向交付密度竞争。DeepSeek的路径很清晰:自研训练栈 + 可控算力 + 开箱即用工具链,比堆参数更能缩短AI落地半径。

开发者现在就能用:

ollama run deepseek-coder:105b-q4_k_m

或通过HTTP接入现有系统:

curl -X POST http://localhost:11434/api/chat

真正的自主权,始于第一次本地generate()调用。

返回首页