ByteNoteByteNote
游戏能跑通,凭什么还不算好玩?
字

字节笔记本

2026年10月9日 · 约 6 分钟读完

游戏能跑通,凭什么还不算好玩?

API中转
¥120

编码 agent 做出一款能启动的游戏并不难,难的是有人愿意多玩一会儿。关卡能过编译、按钮能点,仍可能节奏垮、反馈看不清、难度乱跳。港大 MMLab 和深圳环区实验室的 Recursive Game Creator 把这件事收成一套 harness:不要停在“编译过了”,而要用可复用的试玩策略把体验打出来,再决定下一版改什么。论文 arXiv 2610.08621,Hugging Face 10-08 日榜约 85 票。代码仓 IMBALDY/RecursiveGameCreator,MIT,本轮 API 37 星,2026-10-07 建仓。论文摘要一度写 code coming soon,仓库这周已经公开,README 带安装和快速开始。项目页在作者的 GitHub Pages 上。

设计、实现、试玩、评审四段闭环

四个角色怎么转一圈

Designer 吃用户说明和上一轮评审,写成详细计划。Builder 按计划交出候选游戏,运行时在隔离的 Docker 里,支持 HTML 和 Godot,可选图像、三维资产和 Blender。软件渲染意味着演示机也能跑,不必先抢一张训练卡。Player 不靠慢的图形界面点点点,而是写可复用策略,通过程序接口高频收集轨迹,避免“试玩样本太少、评价偏掉”。论文对比过用图形界面 agent 去点游戏的做法,认为那样又慢又容易偏。Reviewer 用轨迹指标、画面证据和明文偏好,按这款游戏自己的标准打分,留下更好的版本,并给下一轮写改进意见。四个角色共用一轮开发、一堆试玩证据、一封回写给设计的意见,而不是各写各的提示词。

后一版想替换当前保留版,要先过配置里的检查,还要在两种匿名 A/B 顺序里都拿到稳定偏好。这是在防评审自己的位置偏差。项目页有概述视频,以及 MOBA、竞速、视觉小说从 V1 打到 V3 的成对画面。配置项里,brief 是体验说明,--prompt 能覆盖它;source 可以指定已有工程当起点;player.trajectories_per_version 控制每个版本收几条策略;runtime.max_game_instances 限制宿主机上同时开多少个游戏实例。工具装在项目下的本地目录,不要把密钥写进版本库。

官方基准怎么说

GameCraft 与 GameASG 的官方数字

论文写 GameCraft-Bench 总体 77.89,称当时对比里最高。三轮打磨从 72.70 升到 77.89,加 5.19,每个报告类别都涨。GameASG-Bench 严格任务成功率 53.2%,相对同模型基线高 34.1 个百分点;运行时检查平均通过率 93.4%,也是对比里最高。另一处写成功率从 9.47 升到 47 题里的 25 题。用户研究称游玩时间更长、评分更高。这些都是论文数字,不是第三方复现。作者把贡献收成三块:把游戏开发收成可递归的体验闭环;用编程原生的 Player 代替慢的图形试玩;用轨迹加画面加偏好做面向体验的评审。和“生成一版能点开始的演示”相比,它多出来的是留下证据、再决定要不要换版。

本机怎么跑一局

环境要 macOS 或 Linux、Git、Node.js 22、本机 Docker(Compose 和 Buildx)。Python 3.12 由脚本安装。运行时走软件渲染,不要求宿主机 GPU。

bash
git clone https://github.com/IMBALDY/RecursiveGameCreator.git
cd RecursiveGameCreator
sh scripts/setup.sh
source .venv/bin/activate

首次会下依赖、编镜像,并做离线冒烟。只要 Python 和离线模拟、不要 Docker 时,用 sh scripts/setup.sh --minimal。生成走已登录的 Codex CLI,示例配置写的是 gpt-6-astra,请改成账号里有的模型。真实生成会打到你配置的模型服务。可选混元图像或三维时,把示例环境文件拷出来再填密钥,不要把密钥写进仓库。

bash
game-agent start examples/quickstart-html.json \
  --prompt 'Create a keyboard-controlled arcade game with clear goals, readable feedback, and a restart button.' \
  --run-dir runs/first-html

Godot 平台用 examples/quickstart-godot.json。快速开始默认一轮,每个被测版本收三条策略轨迹。把配置里的 rounds 改成 3,就是第 0、1、2 轮。终端会打出阶段耗时;游戏、轨迹和评审记录落在指定的 run 目录。game-agent status、report、stop、resume 用来看进度和接着跑。新的 start 换新目录;resume 前先等上一只控制器停掉,已完成的阶段和对比记录会复用。认证要先 codex login,适配器读本机已有的登录文件。环境检查不过时,先看文档里的排错,再开下一轮生成。

适合已经能让 agent 吐出可运行小游戏、却缺“玩完再改”闭环的人。它不是通用游戏引擎,也不是免费用的模型服务。星数还小,接口可能变。首次安装会拉镜像和 Codex CLI,后面的轮次才会复用缓存层。导出保留版源码和资产用 game-agent export,本地试玩前先看报告目录里的轨迹和评审记录,别只看最后一帧截图。混元一类外部资产是可选项,快速开始不依赖它们也能出一版能玩的 HTML 或 Godot 稿。鱼和熊掌不必一次都要:先用 --minimal 看通流程,再打开完整镜像和多轮打磨。本轮事实来自论文、仓库 README 和 GitHub API。

相关文章

分享: