DeepSeek-V4 Flash端到端推理实测:单卡AMD MI300X+ROCm6.2运行FP8 GEMM与动态KV缓存

DeepSeek-V4 Flash 首次在单张 AMD MI300X 上完成端到端推理——不调用 CUDA,不链接 NVIDIA 闭源库,全程跑在 ROCm 6.2 上:自研 FP8 GEMM kernel、KV cache 动态分页压缩、LLaMA-style attention 的异步 stream 切分全部落地。
DeepSeek-V4 Flash 是 V4 的轻量推理优化版,参数约 16B,支持 128K 上下文,在 MMLU、GPQA、LiveCodeBench 等基准上保持原版 92%+ 能力。实测在单卡 MI300X(192GB HBM3)上,batch=1、seq_len=4096 时连续生成吞吐达 142 tokens/s,显存占用 89GB。对比原版 V4(需双卡 A100,显存占用 137GB),省下一张卡、近 50GB 显存。
三个关键实现:
- ROCm 原生 FP8 GEMM:基于 HIP-Clang 编译,绕过 cuBLAS;RMSNorm、SwiGLU、Rotary Embedding 全部直通 HIP,不依赖
torch.compile或 vLLM 的 CUDA 后端 - 动态 KV Cache 分页压缩:page size=16,压缩率 1.8×,CPU 端无额外开销
- LLaMA attention 异步 stream 切分:拆解计算流,避开 MI300X wavefront 调度瓶颈
代码已开源:deepseek-ai/inference-kernels(MIT 协议),含完整 Dockerfile 和 MI300X 启动脚本。
不再绑定 CUDA
这次部署没碰 CUDA 栈一手指头。所有算子走 HIP:权重加载、FP8 matmul、attention、norm、激活函数——全链路 ROCm 原生。开发者只需:
pip install torch-rocm==2.4.0a0+rocm6.2就能直接 torch.load() 加载模型权重,无需改模型结构、不插任何 patch。
这也验证了 OpenClaw v0.3 的 device-agnostic executor 设计:它的 ROCm 插槽不是占位符,是真能跑的。MI300X 兼容分支下周上线。
开源方案解决实际问题
FP8 不是简单缩放。DeepSeek 用 per-tensor 动态 scaling + 指数补偿(exponent bias shift),把 KV cache 从 FP16 压到 FP8,MMLU 仅掉 0.3%。
内存压缩模块用 ring-buffer page pool,不用传统 PagedAttention 那套 host-device 反复同步。实测首 token 延迟压到 83ms(MI300X),比同配置 A100 的 112ms 快 26%。
对中小团队意味着:
- 单卡 MI300X 能扛起原来双卡 A100 的 RAG 服务
- 昇腾 910B 用户可复用相同 kernel 移植路径(HIP 接口 + FP8 tensor core 驱动)
- yitb.com/stacks/mi300x-deepseek 提供一键部署模板,带 Prometheus 监控和 OpenClaw Agent 注册接口
👉 Binance · OKX · Gate.io · HTX · Bitget
从“能跑”到“敢用”
过去两年,AMD GPU 跑大模型常止步于 POC。这次 V4 Flash 在 MI300X 上达到生产级指标:
- P99 延迟 < 210ms(输出 512 token)
- 错误率 < 0.07%(10k 请求)
- 支持 continuous batching(max_batch=32)
这不是加个插件式的性能补丁,而是推理栈的底层重写。当 kernel 层面完成 ROCm 原生重构,CUDA 就不再是默认选项,只是可选后端之一。
对寒武纪、壁仞、摩尔线程等国产芯片厂商,这条路径很清晰:适配 HIP 接口 + 提供 FP8 tensor core 驱动,就能接入同一套推理引擎。OpenClaw multi-SoC runtime 正按这个逻辑设计,v0.3 将统一调度 MI300X / 910B / MT-3000。
工程师现在能做什么
立即验证:
git clone https://github.com/deepseek-ai/inference-kernels ./run_mi300x.sh --model deepseek-v4-flash(需 ROCm 6.2+ 系统)
- 深度集成:参考 OpenClaw 的
device/rocm_executor.py,把 FP8 kernel 注入 tool-calling pipeline - 硬件选型参考:MI300X 单卡成本约为 H100 PCIe 的 58%,无出口管制限制,适合金融、政务等对供应链安全敏感的场景
- 反馈共建:在 yitb.com/bbs/tag/mi300x 提交你的 benchmark(不同 batch size / context length 下的 latency & VRAM),数据将汇入《异构 AI 推理白皮书》v1.2