
字节笔记本
2026年10月7日 · 约 3 分钟读完
越用越强还要守规矩:ScienceClaw 的自进化账本
agent 越用越强是个诱人的叙事,但多数自进化系统有个暗坑:修好一个任务的策略可能只是过拟合,换个任务就露馅,甚至把错误经验沉淀成了永久技能。arXiv 10 月 6 日放榜的 ScienceClaw(2610.08691,作者 Mingda Zhang 等)正面处理这个问题:先把自进化定义清楚,再给它装上一道验证闸门,最后用 23 个学科的基准算清楚进化的账。

论文把自进化定义成固定参数的程序改进:模型权重全程不动,进化的是 agent 的程序本身。具体循环是先把失败任务和修复后的成功轨迹配对对比,从差异里提取两类候选,Skill 是解题策略,Operator 是可执行能力;然后过闸门,回放必须能复现修复效果,且在独立任务上确有提升,两条全过才保留,任一失败直接丢弃。这套设计的关键在于闸门挡住的正是自进化最常见的事故:修复依赖偶然上下文、策略只在一个任务上灵验。
基准侧的账本算得很细。ScienceClaw-Eval 覆盖农业图像分割、蛋白质适应度排序、天气预报、法律证据检索、代码生成等 23 个自然科学与社会科学学科,每个学科 64 条同分布加 64 条分布外记录,数据集托管在 Hugging Face 的 beita6969/scienceclaw-eval。任务划分很讲究,源集、验证集、保留的同分布集、分布外集和回放集各自独立,评测考的是持续改进而不是一锤子能力,防止 agent 在题目上练过又在同一批题目上考。指标不只看正确率,还看进化增益、旧能力保留、跨任务迁移和成本,防止 agent 为了新任务把老手艺练丢。结果数字扎实:对冻结基线的平均分布外增益加 16.45 个百分点,分布外宏成功率经过七轮进化从 77.72 提到 91.30。

工程上可以直接上手:仓库 beita6969/ScienceClaw 已开源(913 星、MIT 协议),构建在 OpenClaw 网关之上,setup.sh 一键装好完整环境约需 19GB 权重,也支持手动安装,引擎对任何 OpenAI 兼容模型开放,这意味着私有部署的国产模型或本地模型都能当引擎用,敏感学科数据不必出域。对做内部 agent 平台的团队,这份工作的可借鉴点有三条:自进化必须带闸门,回放复现加独立验证缺一不可;指标要盯住保留和迁移,别只看新增;学科跨度拉大到 23 个领域仍能稳定涨点,说明这套方法论不是窄场景技巧。



