ByteNoteByteNote
Reef:3.6 千星开源持续学习基础设施,让 agent 越用越强

字节笔记本

2026年9月19日

Reef:3.6 千星开源持续学习基础设施,让 agent 越用越强

API中转
¥120

本文介绍 Human-Agent-Society 开源的 Reef(3.6 千 stars,Apache-2.0,Python 3.12+)——首个开源的"持续自我改进 agent"基础设施:把 agent 的推理服务、用户反馈、学习更新、版本化交付连成一个闭环,让 agent 仅仅通过"你怎么用它"就不断变强。

项目简介

现有工具链是割裂的:推理引擎(vLLM/SGLang)只管服务、RL 训练框架(Slime/veRL/AReaL)只管训练,两者之间没有反馈回流,更谈不上版本管理。Reef 补的就是中间那段:agent 在服务真实请求时记录交互,用户反馈被匹配到对应记录,合格的记录进入训练管线产出更新,更新经过评估门禁后以版本化产物提交——更新期间服务不中断。

三条学习路径

按你的目标选:

目标路径需要什么
模型越用越强模型权重训练(配 Slime + SGLang)可训练模型 + GPU + 可用反馈
harness 自我改进提示词/规则/技能优化模型端点 + 代表性任务 + 评估器,不需要本地 GPU
科学发现类任务测试时训练(test-time training)执行环境 + 正确性检查器 + 可度量目标

第三条值得注意:改进的不只是权重——agent 的 harness(prompt、规则、技能)本身也是可进化的对象。

工作循环

每个学习周期四步:Serve(服务请求并记录交互)→ Observe(反馈匹配到交互记录、判定资格)→ Grow(从合格记录产出更新)→ Commit(评估门禁筛选后发布版本化产物)。每个步骤在仓库里都有清晰的模块对应,代码可读性好。

安装

需要 Python 3.12+ 和 git-lfs(产物/检查点功能依赖):

bash
git clone https://github.com/Human-Agent-Society/reef.git && cd reef
uv sync

快速上手教程见 reefinfra.ai/docs。

注意事项

  • 权重训练路径需要 GPU 栈;harness 优化路径用远端模型端点即可,门槛低得多
  • 反馈质量决定学习质量——垃圾反馈进,垃圾更新出,评估门禁要配置好
  • 项目 8 月底开源,更新频繁,生产接入前锁定版本

项目链接

分享: