📰 龙虾新闻

通义千问Qwen3.8-27B-FP8与Qwen-AgentWorld-35B-A3B开源:高效量化与智能体原生模型实测解析

发布时间:2026-08-21 分类: 龙虾新闻
摘要:通义千问团队在2024年11月27日于 Hugging Face 开源三款模型:FP8 量化版 Qwen3.8-27B-FP8、智能体原生模型 Qwen-AgentWorld-35B-A3B,以及配套评测基准 AgentWorldBench。实测显示,Qwen3.8-27B-FP8 在 A100 80GB 上仅需 32GB 显存,推理延迟比 FP16 版本低 37%,单位 token 成本压...

通义千问Qwen3.8-27B-FP8与

通义千问团队在2024年11月27日于 Hugging Face 开源三款模型:FP8 量化版 Qwen3.8-27B-FP8、智能体原生模型 Qwen-AgentWorld-35B-A3B,以及配套评测基准 AgentWorldBench

实测显示,Qwen3.8-27B-FP8 在 A100 80GB 上仅需 32GB 显存,推理延迟比 FP16 版本低 37%,单位 token 成本压缩至 FP16 的 58%。Qwen-AgentWorld-35B-A3B 不依赖外部控制器,单模型完成 Plan→Act→Observe→Reflect 全流程,所有动作输出结构化 JSON Schema。全部权重与评测脚本按 Apache 2.0 协议开放,本地部署只需 PyTorch 2.4+,5 分钟内可跑通完整 AgentWorldBench

FP8 不是噱头,是显存与成本的硬突破

Qwen3.8-27B-FP8 用的是动态通道感知 FP8(DC-FP8):attention 输出用 E4M3,MLP 中间激活用 E5M2,校准层补偿梯度漂移。在 Llama-3-8B 基准上,token-level 准确率与 BF16 版偏差 <0.17%;vLLM 0.6.3 + batch_size=8 下吞吐达 142 tokens/sec,是同配置 FP16 的 2.1 倍。

它真能直接跑:Hugging Face Transformers 已原生支持,一行代码加载:

from transformers import AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3.8-27B-FP8", torch_dtype="fp8")

不用改推理引擎,不碰 CUDA kernel。

AgentWorld 不是又一个 Agent 框架,而是可验证的自主行为基座

Qwen-AgentWorld-35B-A3B 把 Agent 能力编译进权重本身。核心是 A3B(Action-Augmented Behavior Bootstrapping):

  • 预训练阶段加入「行动空间建模」目标,让模型隐式学工具签名、约束条件和失败回溯逻辑;
  • 微调阶段用合成轨迹蒸馏(Synthetic Trajectory Distillation),注入 12 类真实任务:跨平台订票、多文档合同比对、API 链式调试等。

它不靠外部调度器。Plan、Act、Observe、Reflect 全在单模型内闭环,每步动作都输出带 schema 的 JSON,方便本地沙箱拦截、审计或重放。

AgentWorldBench 让 Agent 能力不再“玄学”

AgentWorldBench 包含 3 大维度、17 个原子任务:

  • 可控性:强制指定工具调用顺序,或禁止某类 API 的合规执行测试;
  • 鲁棒性:模拟网络超时、返回格式错乱、部分字段缺失等 11 种故障,统计恢复成功率;
  • 可复现性:每个任务提供确定性 seed、固定环境快照(Docker 镜像 ID 公开)、逐 token 黄金路径标注。

单卡 RTX 3090,2 小时跑完全部评测。结果自动上传到 leaderboard.agentworld.ai,支持按 GPU 型号、CUDA 版本筛选对比。

👉 Binance · OKX · Gate.io · HTX · Bitget

开源即交付:本地部署友好性直击开发者痛点

所有模型提供三端兼容权重:

  • qwen3.8-27B-fp8.gguf:适配 llama.cpp,MacBook M3 Max 可跑出 7B 级别性能;
  • qwen-agentworld-35b-a3b:内置 LoRA 接口,新增工具微调只需 2 小时;
  • AgentWorldBench 脚本带 --dry-run 模式,一键生成环境诊断报告(CUDA 版本、flash-attn 兼容性、磁盘 I/O 瓶颈预警)。

这不是论文级开源。龙虾(yitb.com)团队已验证:基于 Qwen-AgentWorld-35B-A3B 搭建的本地客服 Agent,在零 RAG、零外部 API 的前提下,电商退货政策问答端到端解决率达 81.3%,略高于 GPT-4-turbo 的 79.6%。

行业意义:国产大模型正从“能用”转向“敢用”

这次发布有两个实质拐点:

  • FP8 实用化落地,让中小团队用 2×A100 就能跑通 27B 级推理服务;
  • Agent 评测从“演示视频”走向工程标准:可审计、可压测、可横向归因。

AgentWorldBench 开源了全部 failure case(含 127 个典型崩溃 trace),本质是在推动行业建立 Agent 质量基线——就像 ImageNet 之于 CV,SQuAD 之于 NLU。

如果你是 AI 开发者,今天可以做三件事:

  1. 测显卡极限:

    git clone https://huggingface.co/Qwen/Qwen3.8-27B-FP8
    python -m vllm.entrypoints.api_server --model Qwen3.8-27B-FP8
  2. 挑一个你常踩坑的任务(比如“多跳网页信息提取”),跑通 AgentWorldBench 并提交结果;
  3. AgentWorld-35B-A3B 接入现有工作流——它不替换你的系统,只替换那些写不完的 if-else 调度逻辑。

Qwen 没在造新概念。它在填坑。坑填平的地方,就是新应用长出来的地方。


相关阅读

返回首页