World Model Optimizer 评测 2026:把智能体轨迹炼成你自己的小模型
World Model Optimizer 从你的智能体轨迹中蒸馏前沿模型能力并做路由,官方在 RouterBench 上报告「保持前沿质量、成本降低 27%」。本文完整评测。
大多数团队把智能体轨迹当垃圾扔了。World Model Optimizer 的论点是:那批轨迹是你手上最值钱的训练资产——它精确记录了你的智能体真实面对的任务,还附带了前沿模型给出的答案。
wmo 把这份记录炼成一个你自己拥有的小模型,外加一个决定「什么时候值得花钱调前沿模型」的路由器。
World Model Optimizer 是什么?
World Model Optimizer(wmo)是 Experiential Labs 出品的 Python CLI,做两件相互衔接的事:
wmo optimize通过 Tinker API 把收集到的智能体轨迹蒸馏成更小的开源模型,可选闭环仿真训练。wmo serve暴露一个端点,在前沿模型与小模型之间按请求路由。官方称在 RouterBench 上可保持前沿质量的同时降低 27% 成本。
闭环才是关键:新轨迹进来就重跑流水线,你拥有的那个模型会持续变强。
工作流长什么样
pip install world-model-optimizer
wmo providers set # 注册供应商与候选路由模型
wmo build --file traces.jsonl --name my-model
wmo optimize route sweep my-model --traces traces.otel.jsonl
wmo optimize route fit matrix.json --kind knn --out .wmo/models/my-model/policy.json
wmo serve --name my-model
有个细节值得在意评估严谨性的人留意:拟合步骤会确定性地保留 30% 场景用于报告、只在另外 70% 上拟合,而 wmo optimize route report 会自动把参与路由拟合的场景从对比中剔除。这是正确的默认值——它让「省了多少」这件事更难自欺欺人。
核心特性
- 基于自有轨迹的蒸馏——训出的小模型贴合你真实的任务分布,而不是通用榜单。
- 在 OTel 轨迹上拟合路由——对每个已注册模型在留出任务上打分,再拟合路由策略。
- 供应商目录广——可检索各家目录,含 OpenRouter 已发布的 338 个模型。
- 世界模型即 API——用 Python 仿真你的智能体环境,在动生产之前先测再优化。
- 托管平台——
wmo login后可运行托管智能体的当前冠军 harness,评估走 E2B 沙箱。
适合谁用?
这是给有量、有轨迹的团队用的工具。如果你的智能体规模已经让推理支出成为一个明确的成本项,而且手上有 OTel 轨迹可学,那账算得过来——自己拥有的蒸馏模型没有每 token 的加价。
早期阶段则很不合适。只有零星几条轨迹时,蒸馏无从学起,路由也无从路由。先把真实流量跑起来。
如果你只想降本、不想搞训练流水线,LiteLLM 或 Millwright 这类纯路由器能用少得多的工作量拿到一部分收益。wmo 走得更远,恰恰因为它真的训了个模型——这也是它更费劲的原因。想看自主科研方向的相邻工具,可以看 Open Science。
优点与不足
优点: 把被浪费的资产(轨迹)变成自有模型;工作流内建诚实的留出集报告;路由与蒸馏一体;带仿真环境做闭环测试;供应商支持面广;不想自建也有托管版。
不足: 仓库未声明许可证,商用前必须澄清;依赖 Tinker API;需要足量高质量轨迹才有效;27% 是厂商自测的 RouterBench 结果;项目年轻,未关闭 issue 偏多。
价格
CLI 从 PyPI 免费安装。Experiential Labs 另有托管平台,提供托管智能体与 E2B 评估。注意仓库目前未声明许可证——在其上搭商用工作流前建议先确认条款。
常见问题
开始需要什么数据? 智能体轨迹,最好是 OTel 格式。轨迹的质量与数量决定了蒸馏效果的上限。
它会取代我的前沿模型吗? 不会——它做的是路由。难请求照样走前沿模型,简单的走你蒸馏出的小模型,省的钱就来自这里。
27% 这个数字可信吗? 那是项目自测的 RouterBench 结果。方法论(留出 30%、报告剔除拟合场景)是靠谱的,但在按它做预算之前,请在自己的流量上复现一遍。
能商用吗? 先确认。截至本文评测,仓库没有声明许可证,条款处于模糊状态。
探索最佳 AI 研究与对齐 工具
相关文章
为什么 AI Agent 的记忆需要衰减:AIOBR 可演化记忆协议实测
AI Agent 记得越多不一定越聪明。本文用 78 项测试和真实 CLI 结果,解释 AIOBR 如何通过 World Versioning、记忆衰减、轨迹、技能压缩与反事实机制治理长期记忆。
治理为什么决定 AI 系统的演化方向:最小治理动力学 (MGD) 实测
AI 系统的能力不是线性积累出来的,而是在治理信号驱动下发生相变。本文用双稳态、迟滞、跨环境 100% 复现和 58 项测试,解释最小治理动力学 (MGD) 与 OOPPG 经验转移框架如何刻画智能系统的演化。
ModelMap 评测 2026:把 AI 基准变成 3D 尖刺地图
ModelMap(modelmap.tech)评测——一个交互式 3D 可视化工具,把 AI 模型的基准分数变成可探索的形状,数据实时来自 Hugging Face 模型卡片。
Open Science Desktop 评测 2026:本地优先的 AI 科研工作平台
Open Science Desktop 是本地优先、模型无关的 AI 科研工作平台,在一场可审计的会话里跑完整套研究流程——调研、实验、分析、成文。本文评测它能做什么、适合谁。
订阅 9bests 周报,免费领完整版
每周精选 AI 工具测评与更新;订阅即获本清单完整版 + 另外 7 个细分领域(写作 / 图像 / 视频 / 音频 / 对话模型 / 数据 / API 成本)同款速查。
免费订阅并领取 →独立测评,评分不受厂商付款影响 · 双重确认订阅 · 随时退订