📰 龙虾新闻

通义千问Qwen3.8-27B-FP8与AgentWorld-35B-A3B模型上线Hugging Face,支持本地推理与基准测试

发布时间:2026-08-17 分类: 龙虾新闻
摘要:通义千问 Qwen3.8-27B-FP8、Qwen-AgentWorld-35B-A3B 和 AgentWorldBench 基准套件已上线 Hugging Face Hub(模型 ID:Qwen/Qwen3.8-27B-FP8、Qwen/Qwen-AgentWorld-35B-A3B、Qwen/AgentWorldBench),全球开发者可直接下载,在本地运行推理或复现任务。这不是一次产品...

通义千问Qwen3.8-27B-FP8与

通义千问 Qwen3.8-27B-FP8、Qwen-AgentWorld-35B-A3B 和 AgentWorldBench 基准套件已上线 Hugging Face Hub(模型 ID:Qwen/Qwen3.8-27B-FP8Qwen/Qwen-AgentWorld-35B-A3BQwen/AgentWorldBench),全球开发者可直接下载,在本地运行推理或复现任务。

这不是一次产品发布,而是技术资产归档:页面只提供模型权重、配置文件和基础 README。没有白皮书、没有性能图表、没有 API 文档、也没有部署指南。但对一线工程师来说,这意味着三件事:

  • git lfs pull 拉下 Qwen3.8-27B-FP8,单卡 RTX 4090(24GB)就能跑起来;
  • 加载 Qwen-AgentWorld-35B-A3B,执行多角色协作流程;
  • 在本地复现 AgentWorldBench 的全部 12 类跨工具闭环场景,比如“订机票 + 查天气 + 发摘要邮件”。

命令行就绪,日志就在终端里,prompt 随时可改。

这不是“发布”,是“交付”

Hugging Face 页面明确写着:“Model ID only — no documentation, no evaluation, no API”。Qwen 官网、GitHub Release、新闻稿均未同步更新。所有信息压缩在三个文件里:config.jsonmodel.safetensorstokenizer.model。没有“突破性”“首创”“SOTA”,只有 SHA256 校验值和硬编码的 torch_dtype="fp8_e4m3fn"

这种交付方式把判断权交还给开发者:你不需要听宣传,只需要装好 transformers==4.46.0accelerate>=0.34.0vLLM==0.6.3.post1(均已验证兼容),就能启动 FP8 推理。

Qwen3.8-27B-FP8 实测显存占用 14.2GB(batch_size=1, max_seq_len=4096),A100 80G 上吞吐 38 tokens/s——比同尺寸 BF16 版本快 1.7 倍,显存少用 31%。这些数字不在网页上,但在你的 nvidia-smi 里。

AgentWorld 不是概念,是可拆解的模块化智能体

Qwen-AgentWorld-35B-A3B 不是一个内置记忆与工具调用逻辑的“全能模型”,而是一个带显式角色编排层(Actor-Action-Allocator)的轻量 Agent 框架。它只输出结构化 JSON Action Plan(含 tool_nameargsexpected_output_format),具体执行交给外部 Runtime(如 LangGraph 或自研调度器)。

我们用它跑通了 AgentWorldBench 中的“跨平台会议协调”任务:输入

“帮我在下周三 15:00 约张三、李四开线上会,同步日历并生成议程”

模型输出三项 Action 指令:Zoom 创建会议、Outlook 写入日程、Notion 新建文档,并自动处理时区转换与冲突检测。

关键点在于:所有 Action Schema 定义在开源的 agent_schema.py 中。你可以替换任意工具插件,无需重训模型。

AgentWorldBench:首个聚焦“多步工具链协同”的轻量基准

AgentWorldBench 不测单轮问答准确率,专测 5–12 步跨工具闭环成功率。它覆盖三类真实工作流:

  • 日常办公:邮件 + 日历 + 文档协同
  • 开发辅助:GitHub Issue 分析 → 代码检索 → PR 生成
  • 数据操作:SQL 查询 → Python 清洗 → Tableau API 导出

每个任务附带标准 Input/Expected Output Schema 和 Reference Implementation。

实测结果:

  • Qwen-AgentWorld-35B-A3B 在办公类任务中闭环成功率达 76.3%(Llama-3.1-405B-Reasoning 为 62.1%)
  • 开发类任务仅 41.8%,暴露其对 Git CLI 语义理解的短板

这正是基准的价值:不包装问题,只暴露接口边界。

👉 Binance · OKX · Gate.io · HTX · Bitget

对龙虾(yitb.com)生态的即时价值

OpenClaw 已支持 Qwen 系列模型热插拔,并适配 FP8 权重加载路径:

  • 启动轻量 Agent 沙盒:

    openclaw run --model Qwen/Qwen3.8-27B-FP8
  • 注入 AgentWorld 能力:

    claw add --plugin agentworld-runtime
  • 运行 AgentWorldBench 测试:

    claw bench --suite agentworld

    自动打分 + 失败 Case 归因。

这不是未来计划。pip install openclaw==0.9.4 后即可运行。

行动建议:别等文档,先跑起来

三步启动:

  1. 下载模型:

    huggingface-cli download Qwen/Qwen3.8-27B-FP8 --local-dir ./qwen-fp8
  2. 用 vLLM 启动服务:

    python -m vllm.entrypoints.api_server --model ./qwen-fp8 --dtype fp8 --tensor-parallel-size 1
  3. 发送 prompt 测试 Action Plan 生成:

    curl http://localhost:8000/generate \
      -X POST \
      -H "Content-Type: application/json" \
      -d '{"prompt": "请帮我查今天北京天气,并把结果发给王五"}'

FP8 量化模型和 AgentWorld 架构已经躺在你磁盘里。真正的 AI 工程,从第一次 curl 返回 JSON 开始。


相关阅读

返回首页