world-model-optimizer开源:轻量级Agent世界模型优化器支持Llama-3/Qwen2/DeepSeek-V3在线微调

world-model-optimizer 开源:Agent 开发者终于有了开箱即用的世界模型优化器
world-model-optimizer 正式开源。它不是另一个世界模型训练框架,而是一个专为 Agent 场景设计的轻量级优化器:用纯文本定义工具行为,让模型在真实调用链中持续在线微调;实测响应仿真精度接近 Fable 等方案,推理 token 减半,原生支持 Llama-3、Qwen2、DeepSeek-V3、Phi-3 等主流开源模型。部署即用,迭代当天见效。
为什么 Agent 需要“可演化的世界模型”
多数 Agent 框架靠静态工具描述或硬编码 schema 运行。Slack API 升级、CLI 参数变动、甚至一个新错误码出现,整个推理链就崩。world-model-optimizer 不 mock 服务,也不依赖多模态仿真引擎。它把工具行为压缩成结构化文本——比如 curl -X POST https://api.slack.com/chat.postMessage 的输入约束、输出格式、常见错误码、速率限制逻辑,全部写进 YAML + Markdown 混合文件。模型不用 GPU 就能“预演”上千次调用路径,生成高质量训练信号。
轻量、在线、闭环:三个技术锚点撑起生产落地
- 轻量:核心优化器仅 280 行 Python,不依赖 PyTorch/Triton,CPU 即可运行;每个工具的世界模型描述平均 <5KB,可 Git 版本管理、可 PR 评审
- 在线:内置增量训练调度器。当用户 query 触发未覆盖的边界 case(例如“把 Excel 转成带格式 PDF 并邮件发送”),系统自动捕获失败轨迹 → 生成反事实样本 → 触发 LoRA 微调 → 热加载新权重,全程 <90 秒
- 闭环:配套
wmo-evalCLI 工具,一键比对优化前后在 ToolBench、AgentBench 上的成功率与 token 消耗,支持按 domain(如 DevOps/CRM/Research)隔离评估
实测数据:HuggingFace ToolCall 基准上,Qwen2-7B-Agent 经 world-model-optimizer 微调后,任务完成率从 63.2% 提升至 89.7%,单次推理平均 token 从 412 降至 205——算力减半,准确率反升。
不是替代,而是补位:它如何嵌入现有 Agent 工作流
world-model-optimizer 不重写你的 Agent 框架。它只解决一个长期被忽略的问题:模型能力与现实工具生态之间的演化鸿沟。你继续用 LangChain 或 LlamaIndex 编排流程,用 Ollama 或 vLLM 托管模型。wmo 只做一件事——持续告诉模型:“这个世界此刻长什么样”。
它输出三样东西:
- 可插拔的 LoRA 适配器
- 标准化的 tool-spec JSON Schema
- 带置信度标注的仿真日志
OpenClaw(龙虾)生态已集成进 claw-train 命令:
claw-train --wmo --base qwen2:7b即可启动端到端优化流水线。
👉 Binance · OKX · Gate.io · HTX · Bitget
开源即可用:GitHub 仓库已上线,社区进展明确
项目地址:github.com/silennai/world-model-optimizer
包含完整文档、6 个真实工具的 world-spec 示例(GitHub API、FFmpeg CLI、Python REPL、Notion API 等)、Docker 一键部署脚本。首周获 237 star,社区已提交针对 Cursor 插件、Devin-style 代码沙盒、Manus 本地 Agent 的适配 PR。所有模型权重兼容 GGUF 格式;未来三个月将支持量化微调(Q4 LoRA + AWQ 双路径)。
下一步:从“仿真世界”走向“协商世界”
当前版本聚焦单 Agent 单工具链仿真。团队已在预研多 Agent 协同建模模块:让不同 Agent 对同一 API(如 AWS EC2)各自生成世界描述,再通过共识机制收敛出更鲁棒的接口契约。这对构建可信企业级 Agent 集群至关重要。
现在就是入场时机:挑一个你最常调用的工具,运行
wmo init --tool github生成初始 world spec,跑通第一次在线微调。世界不会静止,你的 Agent 也不该停在 v1.0。