🔥 AI资讯
全部新闻 →
热点
DeepSeek-V4 Flash端到端推理实测:单卡AMD MI300X+ROCm6.2运行FP8 GEMM与动态KV缓存
DeepSeekV4 Flash 首次在单张 AMD MI300X 上完成端到端推理——不调用 CUDA,不链接 NVIDIA 闭源库,全程跑在 ROCm 6.2 上:自研 FP8 GEMM kernel、KV cache 动态分页压缩、L...
AI模型排行 · Skills技能 · 行业资讯 · 开发教程 · 生态工具
DeepSeekV4 Flash 首次在单张 AMD MI300X 上完成端到端推理——不调用 CUDA,不链接 NVIDIA 闭源库,全程跑在 ROCm 6.2 上:自研 FP8 GEMM kernel、KV cache 动态分页压缩、L...