
字节笔记本
2026年10月9日 · 约 2 分钟读完
自己变强这件事,终于有了一套能计费的场地
「让模型自己变强」常停在口号。RSIGym 把它收成一套可计费的服务:训练、推理、评测、沙箱、鉴权和预算,agent 只负责选题和改 harness,平台管机器和花钱。仓库 evolvent-ai/RSIGym 目前约 36 星、4 个提交,论文 arXiv 2610.10310,站点 rsi-index.ai。GitHub API 快照里没有许可证字段,复用前要自己看仓库。
RSI-Index 问的是:这些实验补上了多少剩余差距。起点是 0.0000。官方最高写到 Opus 5 的 0.4809。Joint 轨从 Qwen3.5-35B-A3B-Base 起步,单次 Joint 预算示例是 500 美元。

三条轨,五种服务
轨分成数据、harness、联合。服务包括 Tinker/LoRA 训练、推理、rollout、Harbor/E2B 评测、沙箱,以及带额度的密钥。评测集大小写成 100 / 89 / 60 / 100 / 37,分数用 avg@3。官方说 30 次 Joint 里有 29 次超过起点;Terminal-Bench 从 30.34% 到 40.82%;Qwen3.8 自跑 56.26%,对照 56.66%。这些是 README 和站点上的数,不是第三方复现。
跑起来要 Python 3.12 和 uv。先起 auth_server,再按目录起其他服务。任务侧要装 Harbor 0.20,配 rsi_task/.env,然后 sh run.sh。运营侧还要 Tinker、E2B 和一个 rollout 提供方。这不是 pip install 就能在笔记本上闭环的玩具。

适合谁
适合已经有评测预算、想把「模型改数据 / 改 harness / 两者一起」做成可重复实验的实验室。不适合只想看一篇自改进故事的人:仓库新、提交少、外部依赖重。它也不保证你换一套模型还能涨到 0.48。
和普通 RL 环境比,它把花钱和权限写进任务。和单次微调脚本比,它逼你用同一套指数看还剩多少分没吃掉。若你真要复现,先按官方 Joint 预算跑通一次起点,确认 RSI-Index 从 0 动起来,再谈榜上的 Opus 数字。



