通义千问Qwen3.8-27B-FP8与Qwen-AgentWorld-35B-A3B模型上线Hugging Face,含AgentWorldBench基准测试

通义千问 Qwen3.8-27B-FP8 和 Qwen-AgentWorld-35B-A3B 于 2024 年 11 月 27 日上线 Hugging Face。配套发布 AgentWorldBench 基准测试套件。但没有开源协议声明,没有 FP8 实测性能数据,也没有官方 API 接入方式。
模型发布即“裸重”:权重可下,文档全无
Qwen3.8-27B-FP8 使用 FP8 混合精度量化,A100 上理论显存占用约 16GB。Hugging Face 页面未说明 config.json 中 torch_dtype 是否设为 e4m3fn 或 e5m2,也没提是否支持 --load-in-4bit / --load-in-8bit 加载方式。
Qwen-AgentWorld-35B-A3B 引入 A3B(Adaptive Action-Bounded)架构:把工具调用决策拆成两个头——Action Selection 和 Bound Validation,支持动态截断冗余 API 调用链。但模型卡页没给 forward() 签名示例,没定义 tool schema 格式,也没说明 stateful session 怎么管理。想复现推理流程?得自己反向阅读 agentworld.py 里的 run_step() 函数。
AgentWorldBench 不是跑分,是“验活”清单
基准包含 12 类真实 Agent 场景:跨平台 OAuth(GitHub + Notion)、多跳 SQL(含 PostgreSQL 方言适配)、异步 Webhook 响应验证(带 3 秒超时容错)。它不走 AlpacaEval 那套纯文本打分路线,而是强制执行完整工具闭环——比如“用 Notion 创建数据库,并填入爬取的 GitHub issue 列表”。失败就是 0 分。
目前只公开 Python reference runner,没 Docker 镜像,也没 Kubernetes operator 模板。龙虾生态用户已基于这个 Bench 适配 OpenClaw v0.9.3 的 tool_executor_v2 插件。实测 Qwen-AgentWorld-35B-A3B 在单卡 A100 上完成全流程平均耗时 8.2 秒(Llama 3.1-405B 同任务 14.7 秒),但重试率 31%——主要因为 Bound Validation 头误拒了合法请求。
工程就绪度三连问:能跑?能压?能接?
- 能跑:Yes。
transformers>=4.45.0+accelerate>=0.34.0下,27B-FP8 可在单张 RTX 4090(24GB)启动;batch_size=1 时 OOM 风险 <5%; - 能压:No。没提供 vLLM/Triton 优化配置,TGI v2.0.4 加载 Qwen-AgentWorld-35B-A3B 后吞吐仅 3.1 req/s(DeepSeek-V3 同规模达 8.9 req/s);
- 能接:Not yet。没有 OpenAI 兼容 API endpoint,没暴露
/v1/chat/completions路由,也没 FastAPI 服务模板。有团队用llama.cpp改qwen2tokenizer 强行接入 Cursor 插件,但 tool call JSON 结构错位率达 42%。
👉 Binance · OKX · Gate.io · HTX · Bitget
对比国际节奏:预热快,落地慢
Llama 3.1 发布当天就上线 Meta Llama API、Hugging Face Inference Endpoints 和 AWS Bedrock 支持;Claude 3.5 上线 72 小时内,Anthropic 公开了 Function Calling Schema V2 和 Streaming Delta 规范;DeepSeek-V3 直接打包 Docker 化推理服务 + Prometheus 监控指标。而这次 Qwen 发布,只有原始权重和极简 README——没有 benchmark 脚本,没有量化校准日志,没有错误恢复策略说明。“可跑”只是起点,“可测”得自己搭 CI pipeline,“可集成”还得等中间件层补全。
行业意义不在参数,而在 Agent 范式迁移信号
Qwen-AgentWorld 系列首次把“动作边界验证”(Bound Validation)作为独立模块解耦,说明国内大厂正在从 “LLM + Prompt” 转向 “LLM + State Machine + Tool Contract” 三层 Agent 架构。这和龙虾 OpenClaw v1.0 的设计哲学高度一致——state_graph.py 明确要求 transition guard 条件必须可序列化、可审计、可回滚。当 AgentWorldBench 成为事实标准,所有国产 Agent 框架都将面临工具 schema 强约束压力。
硬核开发者现在该做什么?
立即 fork Qwen/AgentWorldBench,运行:
python run_bench.py --model Qwen/Qwen-AgentWorld-35B-A3B --device cuda:0记录失败 case;
- 向 Hugging Face Model Card 提交 PR,补上
inference_examples.py和quant_config.json; - 如果你已在用 OpenClaw,尝试将
agentworld_tool_schema映射到claw_tool_registry。我们将在 yitb.com 下周更新兼容补丁。
真价值不来自“发布了什么”,而来自“你能拿它做成什么”。
相关阅读