字
字节笔记本
2026年9月19日
Reef:3.6 千星开源持续学习基础设施,让 agent 越用越强
API中转
¥120
本文介绍 Human-Agent-Society 开源的 Reef(3.6 千 stars,Apache-2.0,Python 3.12+)——首个开源的"持续自我改进 agent"基础设施:把 agent 的推理服务、用户反馈、学习更新、版本化交付连成一个闭环,让 agent 仅仅通过"你怎么用它"就不断变强。
项目简介
现有工具链是割裂的:推理引擎(vLLM/SGLang)只管服务、RL 训练框架(Slime/veRL/AReaL)只管训练,两者之间没有反馈回流,更谈不上版本管理。Reef 补的就是中间那段:agent 在服务真实请求时记录交互,用户反馈被匹配到对应记录,合格的记录进入训练管线产出更新,更新经过评估门禁后以版本化产物提交——更新期间服务不中断。
三条学习路径
按你的目标选:
| 目标 | 路径 | 需要什么 |
|---|---|---|
| 模型越用越强 | 模型权重训练(配 Slime + SGLang) | 可训练模型 + GPU + 可用反馈 |
| harness 自我改进 | 提示词/规则/技能优化 | 模型端点 + 代表性任务 + 评估器,不需要本地 GPU |
| 科学发现类任务 | 测试时训练(test-time training) | 执行环境 + 正确性检查器 + 可度量目标 |
第三条值得注意:改进的不只是权重——agent 的 harness(prompt、规则、技能)本身也是可进化的对象。
工作循环
每个学习周期四步:Serve(服务请求并记录交互)→ Observe(反馈匹配到交互记录、判定资格)→ Grow(从合格记录产出更新)→ Commit(评估门禁筛选后发布版本化产物)。每个步骤在仓库里都有清晰的模块对应,代码可读性好。
安装
需要 Python 3.12+ 和 git-lfs(产物/检查点功能依赖):
bash
git clone https://github.com/Human-Agent-Society/reef.git && cd reef
uv sync快速上手教程见 reefinfra.ai/docs。
注意事项
- 权重训练路径需要 GPU 栈;harness 优化路径用远端模型端点即可,门槛低得多
- 反馈质量决定学习质量——垃圾反馈进,垃圾更新出,评估门禁要配置好
- 项目 8 月底开源,更新频繁,生产接入前锁定版本
项目链接
- GitHub 仓库:https://github.com/Human-Agent-Society/reef
- 文档:https://reefinfra.ai/docs
- 中文 README:仓库 README.zh.md
分享: