Qwen-AgentWorld-35B-A3B开源:35B参数AI Agent模型,支持结构化思维链与多步工具调用

Qwen 于 2024 年 11 月 27 日在 Hugging Face 开源 Qwen-AgentWorld-35B-A3B:一款专为 AI Agent 设计的 35B 参数模型,实际推理开销接近 7B 模型。它采用 A3B 架构(Activation-aware 3-bit 权重 + 4-bit 激活量化),原生支持结构化思维链(Structured CoT)、多步工具调用(Tool Graph Execution)和状态感知任务规划。同步发布 AgentWorldBench 评测基准(覆盖 API 编排、异步调度、跨平台协同、容错恢复等 12 类核心能力)和 Qwen-Image 多模态组件(视觉指令解析、OCR 增强型图像理解、带空间坐标的 UI 元素定位)。所有代码、权重、评测脚本均以 Apache 2.0 协议开源,可商用、可微调、可离线部署。
Qwen-AgentWorld-35B-A3B:不是更小的模型,而是更“懂 Agent”的模型
传统 Agent 实现常靠 LLM 加 LangChain 或 LlamaIndex 这类框架拼接工具逻辑——推理路径断裂、状态难维护、错误难定位。Qwen-AgentWorld-35B-A3B 把工具执行逻辑直接编入模型架构:内置 Tool Graph Memory(TGM)模块,将工具调用建模为有向无环图节点,模型直接输出 JSON Schema 格式的执行计划,字段包括 tool_id、input_schema、dependency_id 和 timeout_ms,跳过文本解析环节。在 TravelPlanner 和 DevOps-TaskBench 两个真实 Agent 场景中,端到端成功率提升 37%,平均工具调用轮次减少 2.4 次。A3B 量化后,在 NVIDIA A10(24GB)上达到 18 tokens/s 吞吐(batch_size=4),显存占用仅 14.2GB,不依赖 FP16 或 FlashAttention。
AgentWorldBench:首个聚焦“Agent 行为鲁棒性”的开源评测基准
GAIA、WebShop 等现有评测主要看单步决策是否准确,但真实部署中更关键的是:工具失败后怎么重试?长任务中上下文漂移了状态还对不对?并发请求下资源会不会串?AgentWorldBench 从三个维度定义 12 项子任务:
- 工具韧性(Tool Resilience):模拟 API 超时、404、限流,要求模型主动降级或切换备用工具;
- 状态保真(State Fidelity):在“监控 3 天服务器日志并生成周报”这类长周期任务中,验证中间状态缓存与回溯能力;
- 协同可信(Cooperative Trust):多 Agent 协作时,对角色权限、数据可见域、操作审计日志做显式建模。
基准提供 Python SDK 和 Docker 沙箱环境,测试结果可一键复现。
Qwen-Image 组件:让 Agent 真正“看见”并操作界面
Qwen-Image 不是独立多模态大模型,而是面向 Agent 工作流的轻量视觉增强套件:
Qwen-Image-UI:基于 ViT-L/14 微调,支持 iOS/Android/Web 三端控件坐标回归,mAP@0.5 达 82.3%;Qwen-Image-OCR:融合 LayoutLMv3 与 PaddleOCR 轻量头,在票据/表单场景字符识别 F1 达 94.1%;Qwen-Image-Action:将视觉输出映射为可执行动作序列,例如"点击坐标(320,180)→滑动至(320,500)→长按2s"。
所有组件通过统一 Vision-Token Bridge 与 Qwen-AgentWorld 主干对齐,视觉 token 可直接参与 Tool Graph 构建,避免 VLM → LLM → Action 的三次转换损耗。
👉 Binance · OKX · Gate.io · HTX · Bitget
开源即交付:零配置启动一个生产级 Agent
Qwen 提供 qwen-agent-cli 命令行工具,一行命令启动完整 Agent 服务:
pip install qwen-agent-world
qwen-agent-cli --model Qwen/Qwen-AgentWorld-35B-A3B \
--tools weather_api,github_search,shell_exec \
--bench AgentWorldBench/travel_v2 自动完成模型加载、工具注册、评测注入与指标可视化。开发者只需替换 --tools 参数接入自有 API,无需改动模型代码。龙虾(yitb.com)已将该模型集成进 OpenClaw v0.8.2 Agent Runtime,默认启用 TGM 模式与 A3B 推理后端,实测在同等硬件下比标准 Qwen2-72B Agent 方案降低 63% GPU 成本。
行业意义:Agent 开发正从“组装”走向“原生”
这次开源标志着 Agent 技术栈的关键转变:不再把大模型当黑盒调用器,而是当作具备执行语义的“世界模型”内核。A3B 量化证明高精度 Agent 推理不必绑定旗舰 GPU;AgentWorldBench 把评测焦点从“答得对不对”转向“做得稳不稳”;Qwen-Image 则补上了视觉感知到界面操作之间的工程断点。对开发者来说,这意味着:不用再花三周搭工具路由层,不用为状态丢失写上千行恢复逻辑,也不必为 OCR 不准专门收集标注数据。下一步,Qwen 团队将发布 AgentWorld-Router——一个支持动态工具发现与跨模型 Agent 协作的轻量调度器,预计 2025 年 Q1 上线。