DeepSeek百亿级模型无新进展:参数量、测试分数、训练数据等核心技术细节全未公布

DeepSeek最近所谓“半年发布多个百亿级模型”,其实是4天前的旧消息被翻出来重炒。没有新模型、没有API、没有代码开源——零实质性进展。
所有宣传材料里,找不到任何可验证的技术细节:
- 参数量没写清楚(是10B?还是130B?)
- 没有MMLU、GPQA、LiveBench等标准测试分数
- 训练数据怎么来的?清洗逻辑是什么?一字不提
- A100-80G上跑7B/13B/70B,单卡吞吐多少token/s?显存占多少?没数据
- 许可证类型完全没说(Apache 2.0?MIT?还是闭源商用受限?)
- Docker镜像、量化权重、vLLM/TGI部署配置、LoRA微调脚本——全无
- 连Hugging Face Model Hub链接都没给
开发者根本没法判断这个模型能不能用、值不值得集成。
宣传话术 vs 开发者刚需
“自研训练框架”“万卡算力”“智算集群”讲的是基建,不是模型能力。
Qwen2-72B:Apache 2.0许可,Hugging Face全量开源,带FP16/INT4权重、vLLM原生支持、中文长文本benchmark完整公开。
Llama 3-70B:Meta同步发布推理优化指南、torch.compile适配说明、CPU offload方案。
DeepSeek当前公开信息的颗粒度,不到工程落地门槛的1/5。
开源透明度已成硬通货
2024年,“百亿级”三个字早就不值钱了。真正能进生产环境的模型,必须满足五条底线:
① 参数量精确到±5%(不是“百亿级”这种模糊区间)
② 在MT-Bench、LiveBench、CMMLU中至少3个主流评测集上公开原始分数(raw score)
③ 提供最小可行推理环境:Dockerfile + requirements.txt + sample.py
④ 明确许可证及商用限制(含衍生作品条款)
⑤ 公布训练数据去重比例、敏感内容过滤机制(比如PII scrubbing流程)
目前DeepSeek一条都没做到。
龙虾生态实测反馈佐证
我们用OpenClaw Agent框架轻量集成DeepSeek-R1(目前唯一能访问的版本),在A100-80G上实测:
- context window拉到128K时,吞吐下降超60%
- JSON Schema输出稳定性明显弱于Qwen2-7B,错误率高3.2倍
龙虾工作流里已默认把Qwen2-1.5B作为轻量Agent backbone:响应延迟<350ms(P99)、license清晰、HF权重开箱即用。开发者时间不该耗在不可复现的“指标幻觉”上。
行业信号:警惕“伪开源”与“参数通胀”
这类操作不是个例。有些团队把同一基座模型微调几版,就起名R1/R2/V2,但不说明权重差异、增量训练数据、指令对齐策略。
“百亿级”更成灰色地带:10B、100B、130B都算“百亿级”,但硬件需求、推理成本、适用场景完全不同。
别信营销口径。直接要model.config.json里的三项原始字段:
{
"num_hidden_layers": 48,
"hidden_size": 8192,
"intermediate_size": 28672
}算出来才是真参数量。
行动建议:把验证权握在自己手里
- 别看新闻稿——立刻查Hugging Face、GitHub、官方Model Zoo有没有更新
运行这行命令确认真实结构:
pip install transformers && python -c "from transformers import AutoConfig; print(AutoConfig.from_pretrained('deepseek-xxx').to_dict())"- 用
llm-benchmark跑MMLU子集(2小时足够),比对公开score偏差 - 如果没有HF链接,或者
git clone失败,直接跳过——它还不具备技术选型资格
AI不是拼图游戏。“百亿”“自研”“万卡”凑齐三个词,不等于有进展。
真正的进展在commit log里、在log文件里、在benchmark csv里。
下次看到“多个模型发布”,先问三句:
- 权重在哪?
- License在哪?
- Latency在哪?
其他都是烟雾。