
字节笔记本
2026年10月9日 · 约 3 分钟读完
世界用代码写,画面交给同一个渲染器
交互世界要同时满足两件事:状态和规则得自洽,画面还得像真的。AgentGarten 把这两件事拆开:世界用代码写,视图用一个共享的神经渲染器画。论文 arXiv 2610.12374,HF 今日榜大约 87 票。代码在 MirroS-Lab/AgentGarten,Apache-2.0,约 87 星、2 个 fork,项目页 mirros-lab.github.io/agent-garten。
README 原话是 Code determines how the world changes, and the renderer learns how those changes should look。agent 只看见渲染出来的画面,打完一局把玩法写进 playbook,下一轮从笔记接着练。官方对照写的是大约 4 轮对上常规 RL 的千万级回合。

代码世界,统一渲染
后端仿真器保住状态、执行写成代码的规则,向外导出深度和法线。渲染器基于 Cosmos3-Nano,把这些几何变成 RGB。训练分三段:先从首帧做双向 rectified flow,再做带 KV 缓存的块因果自回归,最后用对抗压缩把老师压成少步学生。仓库现在放出的是渲染器、配方和流式推理;世界模板和完整练习环还标着即将提供。检查点在 Hugging Face 的 MirroS-Lab/AgentGarten-renderer。
环境要求 Python 3.11、PyTorch 2.9、CUDA。安装是 pip install -e '.[data,media,wandb,te]',再拉 Cosmos3-Nano 和 Wan 2.2 VAE。推理用 Cosmos3Stream:干净的首帧潜变量起步,每块 4 个潜变量帧,沿着 RCM_ENDPOINTS 去噪再 commit。服务端可用 Triton、cuBLAS 和 CUDA Graph。项目页上的例子包括捉迷藏、逗宠物、过桥谈判、赶羊和装载,分数随轮次涨,比如过桥时间从大约 71 秒降到 41 秒。这些是官方演示数字。

适合谁
适合已经在写仿真器、却苦于每换一个场景就要重训一套视觉模型的人:规则用代码扩,视图共用一个渲染器。不适合只想 pip install 就开打的人。依赖重,世界模板还没完全放出来,现在更像渲染器和论文配套,不是成品游戏平台。
和纯文本环境比,它给了像素级观察。和端到端世界模型比,它把「世界怎么变」留在代码里,渲染器只负责长什么样。仓库一天多一点、星数还低,接口可能改。若你关心的是 agent 能不能在自洽规则里越打越会,先看渲染器能否接上你现成的状态机,再等世界包开源。



