
字节笔记本
2026年10月9日 · 约 6 分钟读完
别再复刻整套系统了,轨迹就能搭世界模型
真要给 LLM agent 练手,最难的往往不是模型,而是环境本身。内部工单系统、遗留控制台、私有 MCP 后端,源码、数据和基础设施经常拿不到,复刻一套可执行沙盒的成本比训练还高。南洋理工大学和香港理工大学团队在 arXiv 2610.06100 给出另一条路:不重建原系统,只用历史交互轨迹,搭一个能接住任务 agent 的语言世界模型。框架叫 Trace2Env,训练免费,代码以 Apache-2.0 开在 ruyue0001/trace2env,本轮仓库快照 28 星,2026-10-04 建仓。Hugging Face Daily Papers 当日约 72 票。

它到底模拟什么
论文把这件事叫 agentic language world modeling。任务 agent 照常输出动作,对面坐着的不是真实终端或网站,而是一个世界模型 agent。后者负责推断下一步观察,以及这次动作会留下什么状态。Trace2Env 的前提很窄也很实用:原系统不可用,但 action-observation 轨迹还在。它不声称还原可执行环境,只重建环境动力学的可查询模型。仓库 README 写得很直白:这些模拟环境可以拿来训练、做可复现沙盒、给工具和 API 做有状态 mock,或把私有、遗留系统先“说圆”。
离线阶段,构造器把轨迹对齐成 worldbook:动作接口和状态种类的 schema、带出处的 grounded evidence、以及规则、不变量、观察契约这类行为知识。在线阶段,世界模型 agent 按需查 worldbook,再叠上当前 episode 的持久状态和情景记忆,提出下一次观察和应提交的状态变更。共享 runtime harness 用 schema 和不变量验收,通过才落盘。于是“删掉 report.txt 当时没输出,后面 cat 必须报缺失”这类跨轮后果,才有机会被保住。
九个环境上的官方数字
评测分两块。单步下一观察用 AgentWorldBench 的 Terminal、SWE、Android、Web,外加 EnvScaler 的 Food、Shopping、Benefits。多轮交互再用 ALFWorld 和 SciWorld。裁判按 Format、Factuality、Consistency、Realism、Quality 五维打 0 到 100 分。世界模型骨干分别是 gpt-5.6-sol 和 deepseek-V4.1-flash,同一套冻结 worldbook,不按骨干重做。

论文表上的平均分:gpt 骨干里 Direct Prompting 69.51,Trace2Env 75.94,高 6.43 分;deepseek 骨干里 68.71 对 75.75,高 7.04 分。14 个环境-骨干组合里,Trace2Env 拿下 11 个最高分,且从不低于 Direct Prompting。消融也写清楚了:只喂 worldbook 的提示,或只留 harness 不给重建知识,都不如两者一起用。
更值得看的是长程一致性。表 2 同时报真实环境成功率 Real、世界模型内成功率 WM,以及把世界模型诱导出的动作拿回真实环境重放的 W2R。ALFWorld 上 Direct Prompting 的 WM 高达 97%,W2R 只有 3%,一致性比 CR 0.032;Trace2Env 的 WM 降到 88%,W2R 却到 85%,CR 0.914。SciWorld 的 W2R 从 45% 升到 60%。作者的判断是:世界模型里“看起来成功”,常常是幻觉出错误转移后继续自洽;真假要看动作能不能迁回原环境。
构造轨迹也不夸张。Terminal 用 Terminal-Bench 2.0 上 20 条,Web 用 WebArena 50 条;EnvScaler 的 Food / Shopping / Benefits 分别留 16、3、15 条成功轨迹。Android 和 SWE 走按任务分组的五折交叉,评估记录只用折外 worldbook。
本机怎么摸一把
仓库要求 Python 3.11 及以上。README 给的演示不需要模型和 API key:
git clone --recurse-submodules https://github.com/ruyue0001/trace2env.git
cd trace2env
python -m pip install -e ".[dev]"论文页和 Hugging Face 还挂了在线 playground,以及 Quanyu001/trace2env_demo 空间里的 worldbook 样例。想看一份重建成品,先翻 worldbook 再决定要不要接自己的轨迹。
谁该跟
适合已经在攒 agent 轨迹、却拿不到原系统的人:终端、仓库、Android、网页、企业内部服务、文字游戏,论文都评过。也适合做评测基础设施的人:与其只报模拟器里的成功率,不如把 W2R 这类回放迁移一起看。它解决不了轨迹覆盖之外的新规则,也明确不是 Terminal-Universe 那种可执行工作区重建。需要真沙盒、真依赖、真副作用时,还是得回到原系统或可执行复刻。本轮数字全部来自论文和仓库页,不是第三方复现。



