Qwen-AgentWorld-35B-A3B开源模型发布:首个语言世界模型LWM支持具身智能多步因果推理

通义千问团队在2024年11月27日于Hugging Face发布了Qwen-AgentWorld-35B-A3B模型权重和配套基准AgentWorldBench。这是首个明确以“语言世界模型”(Language World Models, LWM)为设计目标的开源模型——它不面向对话优化,而是为具身智能构建:能显式建模环境状态,支持多步因果推理。
模型用结构化标记锚定文本与仿真环境,例如<state:room=bedroom,object=drawer,open=true>。输入带状态,输出带副作用,整个过程不依赖视觉编码器,直接生成可执行的动作链:“打开抽屉→取出钥匙→解锁门→推开门”。
目前只开放Hugging Face页面(https://huggingface.co/Qwen/Qwen-AgentWorld-35B-A3B),无技术报告、无SOTA实测数据、无量化或蒸馏版本,也未同步到ModelScope或GitHub。
什么是Language World Models?
LWM不是更大参数的LLM。它改写了语言模型的I/O逻辑:
- 输入中嵌入动态世界状态标记
- 输出强制生成动作-效应对,如
[ACT] open_drawer [EFFECT] drawer_state=OPEN, visible_items=[key]
Qwen-AgentWorld-35B-A3B基于Qwen2.5-32B微调,但训练数据全部来自自研仿真环境AgentWorld的轨迹回放:覆盖12类家庭/办公场景、47种可交互物体、236个原子动作,每条样本含≥5步因果链。
模型不预测下一个词,而是预测“下一步最可能改变哪个状态变量”。这使它区别于ReAct、Plan-and-Execute等prompting方法——世界状态是它的原生建模对象,而非后处理附加信息。
开发者能立刻用它做什么?
能做的事很具体,也很有限:
- 下载权重,在vLLM或llama.cpp上加载(需手动patch状态token embedding层)
- 运行HF提供的
run_bench.py,复现AgentWorldBench的6项子任务得分(Navigation、ToolUse、MultiObjectSearch等) - 基准引入了“状态一致性分数”(SCS):衡量动作是否真实改变了环境状态,而不仅是语法通顺
已有社区用户用它快速定位自己Agent框架中状态跟踪模块的缺陷。
但要注意:
- 没有ONNX导出
- 没有LoRA适配器
- FP16权重体积68GB,无法部署到手机或树莓派
- 没有API服务封装,也没有Docker镜像
和龙虾生态的关系?
龙虾(YITB)Agent Runtime v0.9.3已支持LWM协议扩展。只需在agent_config.yaml中写:
world_model: huggingface://Qwen/Qwen-AgentWorld-35B-A3B任意工具调用节点就能接入LWM的世界状态推理流。
OpenClaw v2.1测试分支内置WorldStateTracker中间件,可自动解析LWM输出中的[EFFECT]字段,并同步更新本地环境图谱。
这不是深度整合,而是协议级兼容。龙虾把LWM当作一种新型“认知协处理器”,不替换现有规划器,只增强其状态感知能力。开发者可用龙虾CLI一键启动带世界建模能力的Agent沙盒,跳过手写状态管理逻辑。
行业意义与冷思考
Qwen这次直击Agent落地的核心痛点:幻觉性动作。当模型说“我打开了冰箱”,传统LLM无法验证这句话是否与当前环境一致;LWM则把“冰箱门=OPEN”变成一个可读写的内存变量。
这对机器人仿真训练、数字员工流程自动化、游戏NPC行为建模提供了新基座。
但必须说清现状:
- 没有第三方在真实硬件(如UR5+RealSense)上的泛化性验证
- 所有benchmark运行在理想化符号环境
- 35B参数量对边缘部署仍是硬门槛
它更像一份高价值的研究提案,而非开箱即用的产品。
下一步建议
AI开发者可以立刻做三件事:
- 在Hugging Face Star该模型,复现AgentWorldBench前两个子任务(Navigation + ObjectFetch),建立基线认知
- 将现有Agent框架接入龙虾Runtime,用
--lwm-mode参数桥接Qwen-AgentWorld-35B-A3B,观察状态同步延迟与错误率 - 关注Qwen是否在12月前发布轻量版(如A3B-7B)或量化权重;若无进展,建议转向自行蒸馏——龙虾社区已发布LWM蒸馏模板(yitb.com/recipes/lwm-distill)
世界模型不会一夜成熟。但今天,接口已经敞开。