AgentWorldBench开源:首个通用智能体Language World Model评测基准

Qwen团队开源AgentWorldBench——全球首个面向通用智能体的Language World Model评测基准。
不是拼凑,而是闭环建模
AgentWorldBench不沿用NLP或强化学习的老路。它把“语言模型即世界模型”(LWM)真正落地:每个测试用例包含三样东西——结构化世界状态(World State)、可交互的环境API、多步任务目标(比如“在虚拟厨房里找出过期牛奶并通知用户”)。Agent必须持续感知环境、推理下一步、调用工具、更新自己对世界的内部表征。
目前覆盖8类核心能力:环境建模、因果推理、长程规划、工具调用鲁棒性、多模态对齐、记忆一致性、错误恢复、跨世界迁移。已发布127个场景,全部基于轻量级Python沙箱实现,不依赖GPU,本地就能跑。
三要素接口,定义什么是“理解世界”
过去Agent评测要么靠人工写任务(WebShop、Mind2Web),要么用简化模拟器(ALFWorld),都难检验Agent是否真在持续建模一个动态世界。
AgentWorldBench首次明确LWM的三个基础接口:
world.step(action):返回带语义标注的观测,含Qwen-Image生成的视觉摘要world.state():输出当前结构化知识图谱快照task.evaluate():按时间步 + 语义正确性双维度打分
World Builder DSL让领域扩展变得直接。30行Python代码就能定义一个带物理引擎的仓储物流仿真世界,并自动接入评测流程。
Hugging Face集成提供evaluate_agent CLI工具,支持一键对比Qwen-Agent、OpenClaw-v2、Manus等主流Agent在相同世界下的两项关键指标:世界建模误差率(WME)和任务完成熵(TCE)。
量化缺口,比SOTA更有价值
现在各家Agent宣称“SOTA”,用的环境不同、任务不同、评估方式不同,结果根本没法比。
AgentWorldBench强制统一观测空间和评估协议,让迭代有可复现的基线。实测显示,Qwen-Agent在该基准上WME比前代下降41%,但跨世界迁移失败率仍有29%——这个数字直接推动团队重写记忆模块。
开发者也能把它嵌进训练循环:每100步调用world.validate(),生成诊断报告,快速定位问题是出在工具调用解析(比如把“打开冰箱”错译成open_door()而非open_fridge()),还是世界状态更新延迟(比如没同步记录用户移动后的新位置)。
OpenClaw v0.4.2起已支持--benchmark=agentworld参数,自动导出符合LWM规范的世界状态日志。
👉 Binance · OKX · Gate.io · HTX · Bitget
基准不是终点,是基础设施的起点
AgentWorldBench不是要取代业务层评测(客服Agent仍需真实对话集),而是为“世界理解”能力立下底层度量标准。就像TensorFlow/PyTorch统一了模型训练范式,它正在统一Agent验收方式。
微软研究院已将其纳入内部评估栈;Hugging Face数据显示,上线两周内已有63个组织fork仓库并提交world定义PR,涵盖医疗问诊、工业巡检等垂直场景。
这意味着:未来Agent模型卡(Model Card)会新增LWM兼容性字段;芯片厂商需要优化世界状态张量的内存布局——硬件、框架、模型三层正被这个基准推着协同演进。
现在就能用
访问Hugging Face AgentWorldBench页面,运行:
pip install agentworldbench
agentworld-benchmark --model qwen-agent --world kitchen_v2拿到首份量化报告。
如果你正在开发自有Agent,用World Builder DSL定义1个核心业务场景(比如电商售后流程),提交到社区仓库。首批通过审核的世界定义将获得Qwen官方镜像加速支持。
别等“完美Agent”。先让世界可测量。
相关阅读