
字
字节笔记本
2026年10月4日 · 约 3 分钟读完
教 agent 干活的课,从搭训练环境开始
API中转
¥120
想给自己的 agent 做强化学习训练,第一步往往就卡在环境上:奖励怎么定义、沙箱怎么搭、rollout 怎么跑、训练框架接哪个。adithya-s-k 的 FineEnvs 把这条路从起点到终点铺成了教材,副标题就叫 RL Environments 101,在 LLM 时代搭好并扩展强化学习环境。仓库 Apache 2.0,四个环境、六套框架、十九个实现、十个已部署的 Hugging Face Spaces。

项目简介
它的第一价值是跨框架:同一个环境分别在 openenv、OpenReward、NVIDIA NeMo Gym、Prime Intellect 的 verifiers、skyrl_gym、gem 六套主流 harness 下给出实现,写法差异摆在一起对照,迁移成本一目了然。环境本身也挑得有代表性:Jupyter agent(E2B 沙箱)、纯 Python 的 Wordle、带 19 个工具的桌面环境、LaTeX OCR(训练 Qwen3-VL-2B 对打在线奖励服务)、水彩画(Qwen3.5-35B 用 p5.brush 作画,审美偏好模型打分)、地理猜测(Qwen3.5-4B 从街景定位)。
核心内容

- 训练口径不空谈:项目 01 演示 GRPO 训练对着已部署的奖励服务跑通,GPU 起训用一条 curl 脚本拉 Jupyter 环境。
- 数据集彩蛋:SmolDataEnvs 收录 5394 条经人工核验的 Kaggle 数据分析任务,拿来当 RL 环境或评测集都行。
- agent 技能:npx skills add adithya-s-k/FineEnvs,coding agent 可以直接学会按这套范式生成自己的环境。
- 如实的短板:项目 04 与 05 仍标施工中,仓库 320 星社区尚小,定位是教材与脚手架而非开箱产品。
快速上手
bash
git clone https://github.com/adithya-s-k/FineEnvs
cd FineEnvs
cp .env.example .env
cd 00-environments-101/envs/wordle/verifiers
uv sync && uv run python rollout.py从最简单的 Wordle 环境起步,一条 uv 命令看到 agent 在环境里翻滚,再顺着编号往上走。
适合谁用
计划给自家 agent 上 RL 的团队,先用它把全流程走通再自建环境,能省掉大量试错;教 agent 相关课程的老师,这套分编号的项目就是现成实验大纲;想理解六套 harness 差异的工程师,对照阅读价值最高。早期项目就早期用法:当教材读,别当依赖装。
相关文章
分享:



