DeepSeek暂停融资背后:国产万卡集群互连带宽瓶颈致算力损失3.2倍

DeepSeek官方暂停新一轮融资。Hacker News上泄露的一份内部技术备忘录首次披露:在相同模型规模下,中美万卡级训练集群的实际有效算力相差3.2倍——这直接导致模型收敛慢47%,128K+上下文窗口难以稳定运行,多模态对齐阶段GPU显存溢出率升至原来的3.8倍。
泄露文件揭示的真实瓶颈
备忘录指出,DeepSeek-VL多模态训练中,Vision Transformer与LLM主干之间的梯度同步延迟平均为89ms(美国同类集群为28ms)。根本原因在于国产互连带宽仅1.2TB/s,而NVLink 5.0已达3.6TB/s。
长上下文微调时,FlashAttention-3在昇腾910B集群上的吞吐量只有A100的58%。问题出在自定义kernel未适配昇腾CANN 7.0的异步内存调度机制。
MoE与算子压缩成破局关键
团队已将R1推理架构切换为动态稀疏MoE:每Token只激活2/8个专家。8B模型在单机8卡上,128K上下文的KV缓存从32.6GB压到19.3GB。
更关键的是,开源工具包 ds-kernel-pack 已集成17个国产芯片专用算子,包括针对寒武纪MLU370优化的FP16×INT4混合GEMM。在DeepSeek-Coder-33B代码生成任务中,实测提速2.1倍。
👉 Binance · OKX · Gate.io · HTX · Bitget
开源策略倒逼工程创新
融资暂停反而加快了技术透明化节奏:
- DeepSeek-VL v2.1移除全部闭源视觉编码器,改用Qwen-VL-Open权重 + 自研Cross-Modal Adapter,训练成本降34%;
- R1发布时同步开源
torch_npu_fused_rmsnorm和ascend_flash_attn,GitHub Star在48小时内突破2.3k; 龙虾(Lobster)生态已接入该适配层,OpenClaw Agent开发者可直接调用:
claw.run("deepseek-r1-npu")
国产芯片协同进入深水区
备忘录附录强调:当前瓶颈不在单卡峰值算力,而在“系统级算力兑现率”。A100集群实际训练效率达理论值68%,主流国产方案平均仅31%。
突破点正转向软硬协同:
- 华为已向DeepSeek开放昇腾910C底层Tensor Core调度权限;
- 壁仞BR100联合DeepSeek完成INT8量化感知训练(QAT)全流程验证,预计Q4支持R1全参数微调。
训练集群无法线性扩展时,竞争力来自三件事:更聪明的架构选择、更极致的算子榨取、更开放的协作接口。
对开发者来说,现在就是切入国产大模型工程栈的好时机:
git clone https://github.com/deepseek-ai/r1-npu.git
cd r1-npu && lobster deploy --device ascend跑通第一个128K上下文推理实例——真实瓶颈,总是在跑起来之后才真正浮现。