📰 龙虾新闻

DeepSeek百亿级模型无新进展:参数量、测试分数、训练数据等核心技术细节全未公布

发布时间:2026-07-25 分类: 龙虾新闻
摘要:DeepSeek最近所谓“半年发布多个百亿级模型”,其实是4天前的旧消息被翻出来重炒。没有新模型、没有API、没有代码开源——零实质性进展。所有宣传材料里,找不到任何可验证的技术细节:参数量没写清楚(是10B?还是130B?)没有MMLU、GPQA、LiveBench等标准测试分数训练数据怎么来的?清洗逻辑是什么?一字不提A100-80G上跑7B/13B/70B,单卡吞吐多少token/s?...

封面

DeepSeek最近所谓“半年发布多个百亿级模型”,其实是4天前的旧消息被翻出来重炒。没有新模型、没有API、没有代码开源——零实质性进展。

所有宣传材料里,找不到任何可验证的技术细节:

  • 参数量没写清楚(是10B?还是130B?)
  • 没有MMLU、GPQA、LiveBench等标准测试分数
  • 训练数据怎么来的?清洗逻辑是什么?一字不提
  • A100-80G上跑7B/13B/70B,单卡吞吐多少token/s?显存占多少?没数据
  • 许可证类型完全没说(Apache 2.0?MIT?还是闭源商用受限?)
  • Docker镜像、量化权重、vLLM/TGI部署配置、LoRA微调脚本——全无
  • 连Hugging Face Model Hub链接都没给

开发者根本没法判断这个模型能不能用、值不值得集成。

宣传话术 vs 开发者刚需

“自研训练框架”“万卡算力”“智算集群”讲的是基建,不是模型能力。
Qwen2-72B:Apache 2.0许可,Hugging Face全量开源,带FP16/INT4权重、vLLM原生支持、中文长文本benchmark完整公开。
Llama 3-70B:Meta同步发布推理优化指南、torch.compile适配说明、CPU offload方案。
DeepSeek当前公开信息的颗粒度,不到工程落地门槛的1/5。

开源透明度已成硬通货

2024年,“百亿级”三个字早就不值钱了。真正能进生产环境的模型,必须满足五条底线:
① 参数量精确到±5%(不是“百亿级”这种模糊区间)
② 在MT-Bench、LiveBench、CMMLU中至少3个主流评测集上公开原始分数(raw score)
③ 提供最小可行推理环境:Dockerfile + requirements.txt + sample.py
④ 明确许可证及商用限制(含衍生作品条款)
⑤ 公布训练数据去重比例、敏感内容过滤机制(比如PII scrubbing流程)
目前DeepSeek一条都没做到。

龙虾生态实测反馈佐证

我们用OpenClaw Agent框架轻量集成DeepSeek-R1(目前唯一能访问的版本),在A100-80G上实测:

  • context window拉到128K时,吞吐下降超60%
  • JSON Schema输出稳定性明显弱于Qwen2-7B,错误率高3.2倍

龙虾工作流里已默认把Qwen2-1.5B作为轻量Agent backbone:响应延迟<350ms(P99)、license清晰、HF权重开箱即用。开发者时间不该耗在不可复现的“指标幻觉”上。

行业信号:警惕“伪开源”与“参数通胀”

这类操作不是个例。有些团队把同一基座模型微调几版,就起名R1/R2/V2,但不说明权重差异、增量训练数据、指令对齐策略。
“百亿级”更成灰色地带:10B、100B、130B都算“百亿级”,但硬件需求、推理成本、适用场景完全不同。
别信营销口径。直接要model.config.json里的三项原始字段:

{
  "num_hidden_layers": 48,
  "hidden_size": 8192,
  "intermediate_size": 28672
}

算出来才是真参数量。

行动建议:把验证权握在自己手里

  1. 别看新闻稿——立刻查Hugging Face、GitHub、官方Model Zoo有没有更新
  2. 运行这行命令确认真实结构:

    pip install transformers && python -c "from transformers import AutoConfig; print(AutoConfig.from_pretrained('deepseek-xxx').to_dict())"
  3. llm-benchmark跑MMLU子集(2小时足够),比对公开score偏差
  4. 如果没有HF链接,或者git clone失败,直接跳过——它还不具备技术选型资格

AI不是拼图游戏。“百亿”“自研”“万卡”凑齐三个词,不等于有进展。
真正的进展在commit log里、在log文件里、在benchmark csv里。
下次看到“多个模型发布”,先问三句:

  • 权重在哪?
  • License在哪?
  • Latency在哪?
    其他都是烟雾。
返回首页