📰 龙虾新闻

Qwen 3.8-27B正式发布:FP8量化显存减半精度达99.2%,支持原生多步工具调用,Hugging Face一键部署

发布时间:2026-08-20 分类: 龙虾新闻
摘要:Qwen 3.8-27B 正式发布:FP8量化下保持99.2%原始精度,AgentWorld架构支持原生多步工具调用,编码与数学推理实测超越Llama-3.1-70B,首个在 Hugging Face 可直接部署、无需定制编译的国产 Llama-3.1 级主力开源模型。FP8 量化:显存减半,精度几乎不掉Qwen 3.8-27B 在 Hugging Face(https://huggingf...

Qwen 3.8-27B正式发布:FP8

Qwen 3.8-27B 正式发布:FP8量化下保持99.2%原始精度,AgentWorld架构支持原生多步工具调用,编码与数学推理实测超越Llama-3.1-70B,首个在 Hugging Face 可直接部署、无需定制编译的国产 Llama-3.1 级主力开源模型。

FP8 量化:显存减半,精度几乎不掉

Qwen 3.8-27B 在 Hugging Face(https://huggingface.co/Qwen/Qwen3.8-27B)发布即支持原生 FP8 权重加载(torch.float8_e4m3fn)。MLPerf-Inference v4.1 测试显示:A100-80G 单卡、batch=4、seq=2048 下,吞吐达 142 tokens/s;MMLU-5-shot(86.7)、HumanEval+(72.3)、GPQA-Diamond(41.9)三项指标仅比 FP16 低 0.8 / 0.6 / 0.3 个百分点。
显存占用从 FP16 的 48GB 直接压到 29GB,pipeline 不改一行代码。
对比 Llama-3.1-70B 的 FP8 方案——依赖 vLLM + 自定义 CUDA 内核——Qwen 3.8-27B 原生兼容 transformers >= 4.45llama.cpp >= 0.32from_pretrained 就能跑。

AgentWorld:把 CoT 编译成可执行图

Qwen 3.8-27B 首次集成 AgentWorld Runtime Layer:一个轻量、无状态的推理中间件,将传统 Chain-of-Thought 显式转为 DAG(有向无环图)。
ToolBench-v2 实测:多步工具调用成功率 91.4%(+12.6pp),平均步骤数减少 2.3 步。
模型输出不再是自由文本指令,而是结构化 JSON Schema,含 tool_callssubtask_dependenciestimeout_ms 字段,可直连 LangChain 0.3.x 或 龙虾 OpenClaw v2.1 的 Executor 模块。
安装 pip install qwen-agentworld,几行代码就能注入现有 Agent 框架,不重训、不微调。

编码与推理:硬指标全拉满

  • HumanEval+(164 个带类型约束与边界测试的 Python 任务):72.3 → 超 CodeLlama-70B(68.9)和 DeepSeek-Coder-33B(69.4)
  • SWE-bench Verified(真实 GitHub PR 修复验证集):58.1%,当前开源模型最高

训练数据重构是关键:

  • 移除低质量 StackOverflow dump
  • 新增 12TB GitHub Issues + PR Comments 对齐数据
  • RLHF 阶段引入 CodeCorrect Reward Model(基于 diff 语义相似性打分)

实测生成的 PyTorch CUDA kernel 补丁,nvcc -O3 编译通过率 93%+,前代仅 62%。

27B,但逼近 Llama-3.1-405B 的能力

MMLU(86.7 vs 87.1)、GSM8K(95.3 vs 95.6)、MBPP+(83.2 vs 83.9)——三项核心指标几乎持平。
靠的是三处架构优化:

  • Dynamic RoPE Scaling:上下文最大扩至 256K
  • Grouped-Query Attention + 8-head KV cache 共享
  • Token-Level Speculative Decoding head:prefill 阶段并行预测后续 3 token,decode 加速 1.8x

结果:单台 RTX 6000 Ada(48GB)即可全量运行,支持 128K 上下文 + 工具调用,AI Agent 本地部署门槛直接下移。

👉 Binance · OKX · Gate.io · HTX · Bitget

开发者现在就能做这些

  • 下载权重:Hugging Face(2026年8月14日23:00 UTC 发布)
  • 加载:

    from transformers import AutoModelForCausalLM
    model = AutoModelForCausalLM.from_pretrained(
        "Qwen/Qwen3.8-27B", 
        torch_dtype=torch.float8_e4m3fn
    )
  • 服务化:推荐 Text-Generation-Inference v2.4.1(已内置 FP8 适配)
  • 接入 Agent:参考 qwen-agentworld/examples/openclaw_integration.py,该脚本演示如何将 Qwen 3.8-27B 设为 OpenClaw v2.1 默认 LLM Provider,自动解析 web_searchcode_execgit_commit 等工具调用

权重不含任何商业闭源训练数据,Apache 2.0 协议,科研与商用均可自由使用。

这不是又一个开源模型

Qwen 3.8-27B 的意义在于转向“推理基础设施”:当 Llama-3.1-405B 仍需千卡集群微调时,27B 模型已能跑通完整 Agent 闭环。
边缘 AI、私有化 Agent 部署、教育场景轻量沙盒——这些真正需要落地的场景,现在有了可用的主力选择。
下一步:

  • MoE 变体 Qwen3.8-MoE-56B(9 月上线 Hugging Face)
  • 与龙虾 OpenClaw 深度协同的 Runtime Optimizer:将 AgentWorld DAG 编译为 ONNX Graph,端侧延迟再压

别等“完美模型”。用 Qwen 3.8-27B,今天就跑通你的第一个生产级 AI Agent 流水线。


相关阅读

返回首页