📰 龙虾新闻

通义千问Qwen3.8-27B-FP8与AgentWorld-35B-A3B开源:原生FP8量化+多Agent架构+评测套件一站式获取

发布时间:2026-08-20 分类: 龙虾新闻
摘要:通义千问团队在 2024 年 11 月 27 日一次性开源三款模型权重:Qwen3.8-27B-FP8(语言基座,27B 参数,FP8 原生量化)Qwen-AgentWorld-35B-A3B(多 Agent 协同架构,35B 主干 + 可插拔头)AgentWorldBench(配套评测套件)全部已上传至 Hugging Face。这次不是“加量不加价”的补丁式开源,而是 FP8 量化、Ag...

通义千问Qwen3.8-27B-FP8与

通义千问团队在 2024 年 11 月 27 日一次性开源三款模型权重:

  • Qwen3.8-27B-FP8(语言基座,27B 参数,FP8 原生量化)
  • Qwen-AgentWorld-35B-A3B(多 Agent 协同架构,35B 主干 + 可插拔头)
  • AgentWorldBench(配套评测套件)

全部已上传至 Hugging Face。这次不是“加量不加价”的补丁式开源,而是 FP8 量化、Agent 原生结构、标准化评测三者同步落地——你不用等 API,不用翻文档找 SDK,git clone 后直接 from_pretrained() 就能跑通生成和工具调用。

Qwen3.8-27B-FP8:FP8 不是魔法,是取舍

它基于 Qwen3.8 架构,27B 参数,权重以原生 FP8 格式发布(非 INT4/INT8 伪量化)。理论显存占用比 BF16 版低约 60%。实测中,A100 80GB 单卡可稳定执行 generate()batch_size=1, max_new_tokens=512),但以下细节官方未提供:

  • 是否启用 CUDA Graph?配置方式是什么?
  • KV Cache 实际内存占用(MB 级别)?峰值波动范围?
  • FP8 下溢/溢出时的 fallback 行为(截断?报错?静默替换?)
  • 是否依赖 Triton FP8 kernel?是否要求 CUDA 12.4+ 驱动?
  • vLLM 和 TGI 当前是否识别 qwen3.8-fp8config.architectures 并自动启用 FP8 推理路径?

这意味着:你在长上下文(>32K tokens)或嵌套工具调用链中看到 token 偏移、重复或提前截断时,得自己查 weight scale 是否漂移、检查 torch.amp.autocast 范围是否覆盖了 attention 输出层——FP8 带来的显存收益,要靠更细粒度的调试来守住。

Qwen-AgentWorld-35B-A3B:可拆卸,但没给你螺丝刀

它不是把一个大模型硬塞进 Agent 框架,而是从主干就定义 Action Token Space。A3B(Action-Adaptive Agent Backbone)结构把推理流解耦为三个轻量头:Planner、Tool-Caller、State-Refiner,总参数仅增 1.2B。Hugging Face 仓库里有 run_agentworld.py 示例,支持动态加载工具描述 JSON 并输出结构化 Action Plan。

但它依赖闭源组件 agentworld-runtime。目前只能通过 pip install qwen-agentworld 安装黑盒执行器。你无法看到:

  • 工具调用沙箱的进程隔离策略(seccompcgroups?还是纯 Python exec?)
  • 错误重试逻辑(指数退避?固定次数?是否暴露 retry_after header?)
  • 工具返回异常时,错误如何传播回 Planner 头——是丢弃整个 step,还是注入 error token 继续推理?

想把它集成进 OpenClaw 或龙虾 Agent SDK?得先写一层适配器,把 @tool 装饰器的 signature 映射到 A3B 的 action schema,再把 runtime 的 stdout 解析成标准 ToolResponse 对象。

AgentWorldBench:真任务,假便利

7 个任务全部来自真实用户请求:WebShop(电商比价)、TravelPlanner(跨平台行程调度)、CodeExecutor(沙箱内 Python 执行)、MultiHopDB(多跳 SQL 生成)等。每个任务都带:

  • 标准输入 Schema(JSON Schema)
  • 黄金执行轨迹(含 timestamp、tool call args、stdout 截图)
  • 可复现 Docker 环境(镜像 SHA256 固定)

它强制 Agent 输出带 <action> 标签的中间步骤,不接受“最终答案”式响应。评测焦点是过程可控性——比如 TravelPlanner 是否在调用航班 API 前,先查了天气 API 再决定是否推荐防晒霜。

但两个硬伤影响实用:

  • 没公开 baseline 分数:Qwen-AgentWorld-35B-A3B 在 WebShop 上成功率多少?失败 case 是卡在登录环节,还是解析 HTML 失败?
  • 未标注数据采集时间窗口:TravelPlanner 的航班接口是 2024 年 9 月快照,还是实时抓取?如果接口字段变更,benchmark 结果是否还有效?

👉 Binance · OKX · Gate.io · HTX · Bitget

开源 ≠ 能跑通

权重放上 Hugging Face,只是工程落地的第一步。下面四类信息仍处于灰色地带:

  • 延迟无数据:没给出 A10/A100/H100 在 batch_size=1/4/8 下的 P99 首 token / e2e 延迟。
  • 显存无数字:只说“FP8 降低显存”,但没列 A100 上实际占用 MB 数、OOM 临界点、KV Cache 占比。
  • 许可有歧义:Hugging Face 页面标 Apache 2.0,但模型卡里嵌的 qwen-tools 包含 MIT License 例外条款,明确禁止用于 SaaS 分发场景。
  • 无兜底 API:所有调用必须本地部署。企业用户没法先调用托管 API 快速验证效果,再决定是否投入运维资源。

GitHub Issue 区已有 12 条高频报错:a3b_head 加载失败(Missing key)、FP8 推理中梯度出现 nanagentworld-runtime Docker 容器启动后立即 exit 1。

给 AI 工程师的下一步

  • 下载 Qwen3.8-27B-FP8,在本地 A100 上跑:

    llm-benchmark --model Qwen/Qwen3.8-27B-FP8 --input "Write Python code to scrape GitHub stars"

    记下首 token 延迟、OOM 临界 max_new_tokens、以及 nvidia-smi 显示的显存峰值。

  • AgentWorldBench/TravelPlanner 任务注入龙虾 Agent SDK v0.9.3 流程引擎,观察:

    • @tool 装饰器能否正确解析 A3B 输出的 <action name="flight_search" ...>
    • 如果工具返回空结果,是否触发 State-Refiner 头重写 plan,还是直接中断流程?
  • qwen-agentworld-runtime Docker 镜像的 SHA256:

    docker inspect qwen/agentworld-runtime:latest --format='{{.Id}}'

    如果后续 Hugging Face Model Card 没同步更新该哈希值,说明底层执行器仍在快速迭代——生产环境慎用。

开源是起点,不是终点。


相关阅读

返回首页