world-model-optimizer开源:轻量文本世界建模器提升Agent推理准确率至92.3%

world-model-optimizer 开源:专为 Agent 优化的文本世界建模器
world-model-optimizer 现已开源——它不微调大模型权重,也不依赖黑盒蒸馏。它用可验证的文本世界建模(Text World Modeling)持续提升专用 Agent 的性能。
工具复现了 QwenAgentWorld 的核心范式:构建轻量、可执行、带状态反馈的仿真环境。Agent 在模拟的真实请求流中自主迭代路由策略与响应逻辑。
在金融客服和运维诊断两类任务上,推理准确率达 92.3%,接近 Fable 基准(93.1%)。全周期训练 + 部署开销降至传统 LoRA 微调方案的 47%。所有中间态世界模型、奖励信号、优化轨迹全部开源,可完整复现。
核心思路:建世界,而不是改参数
world-model-optimizer 不动模型权重,只建世界。
它把真实 API 调用链、工具返回格式、用户纠错反馈等结构化为可解析的文本世界状态机(State Machine),支持动态注入延迟、错误码、部分响应等生产噪声。
例如,优化一个对接 Jira + Slack 的运维 Agent 时,工具自动构造包含“Jira ticket 创建成功但 Webhook 超时”“Slack 消息发送被 rate limit 拦截”等 17 类边缘 case 的世界子图,并生成对应推理路径的 reward trace。
整个流程无需 GPU 集群:单卡 A100,2 小时内完成一轮世界建模 + 策略蒸馏,输出 <5MB 的轻量 Router 模块,可直接嵌入龙虾 Agent 或 OpenClaw Runtime 的决策层。
技术栈:纯 PyTorch + LangChain,无闭源依赖
代码库(GitHub: silennai/world-model-optimizer)采用三层设计:
- 底层
WorldSimulator:用 LLM-as-Judge 生成带因果链的测试用例 - 中层
RewardCompiler:将用户隐式反馈(重试、跳过、编辑发送)编译为稀疏 reward 信号 - 顶层
RouterTrainer:用 PPO-Lagrange 对齐多源模型(Frontier LLM + OS-native tool caller + local cache retriever)的调度权重
依赖仅限:
torch>=2.1langchain-core==0.2.10datasets
所有 benchmark 数据集(含 3 个脱敏的真实 Agent 日志样本)随代码发布。Docker 镜像内置 CI 流水线,运行 make test 即可一键复现论文 Table 3 全部结果。
👉 Binance · OKX · Gate.io · HTX · Bitget
对龙虾与 OpenClaw 开发者的实际价值
龙虾 Agent 开发者可直接接入 lobster-core 的 agent_optimizer 插件点——只需定义 tool_schema 与 feedback_hook,即可启动世界建模闭环。
某电商售后 Agent 接入后,退货政策问答的幻觉率从 18.6% 降至 3.2%,Router 模块推理延迟稳定在 47ms(原始 Qwen2-7B 为 320ms)。
OpenClaw 生态更简单:world-model-optimizer 输出的 Router JSON Schema 天然兼容 OpenClaw 的 ActionPlan 协议。开发者可直接将其作为 planner 子模块热替换,无需修改任何执行引擎代码。
中小团队用 1/3 预算,就能跑出接近 Manus 级 Agent 的线上稳定性。
它解决了什么问题?
当前 Agent 优化有两个痛点:
- 微调成本高:一次 LoRA 微调需 8×A100×24h
- 效果不可归因:“为什么这个 prompt 变好了?” 没人说得清
world-model-optimizer 把优化对象从“模型权重”转向“世界表征”。每次性能提升都可追溯到具体世界状态节点,比如:
“修复了 AWS Lambda timeout 场景下的重试逻辑”
Agent 工程正在进入新阶段:开发者不再竞相堆卡训大模型,而是竞相构建更精准、更廉价、更可审计的文本世界。当世界模型成为 Agent 的“数字孪生沙盒”,自主进化才真正具备可扩展基础。