ByteNoteByteNote
向老师学几轮之后,学生为什么垮了?
字

字节笔记本

2026年10月8日 · 约 3 分钟读完

向老师学几轮之后,学生为什么垮了?

API中转
¥120

agent 从自己的部署轨迹里学习,最直接的路径是自我蒸馏:拿带特权信息(Privileged Information,事后才知道的答案类信息)的完整轨迹当教材,蒸出一版更强的学生,再部署、再收集、再蒸馏。听起来是滚雪球,实验里却常是滚下坡:性能随周期数一路下滑,连特权信息可用时的表现也在掉。ReSAIL(arXiv 2609.39306,作者 Shengjie Jin 等,9 月 30 日提交,Hugging Face 10 月 8 日论文榜 22 赞)给出了第一份系统性的坍缩分析与治理方案。

ReSAIL 封面图解

垮掉的机制

作者的诊断是:逐轮蒸馏在悄悄磨掉学生模型在特权信息条件下的行为。第一轮学生还能从教师那里学到完整的条件行为,第二轮开始学生学的是上一轮学生的残影,误差逐轮累积,特权信息带来的判断力被稀释殆尽。这与昨日我们介绍的自进化病灶形成互补:R-Quest 查出的是出题侧的问题质量塌方,ReSAIL 查出的是学习侧的行为漂移,两条线合起来说明自进化的风险分布在管道的多个环节。

两步止血

ReSAIL 是插件式增强,不改主训练流程。第一步选步:不是整条轨迹均匀蒸馏,而是挑出特权信息最能撬动教师预测的那些交互步,这些步才是特权信息的价值所在;同时在多条轨迹之间平衡蒸馏损失,防止长轨迹淹没短轨迹。第二步正则:学生在特权条件下的输出,无论选中步还是未选中步,都向冻结教师看齐。冻结教师在这里起锚的作用,标准不随轮次漂移,把下一轮训练需要的行为基线保住。

坍缩机制与插件设计

数字与边界

效果在 ALFWorld 和 TextCraft 两个环境、多个模型规模上验证:三个蒸馏周期持续增益,叠加到自蒸馏基线后末轮成功率平均再提 22.5 个百分点;离线数据选择那套敏感性方法还顺手提升了 AITZ 基准上多模态 GUI agent 的动作预测。论文称这是迭代 agent 自蒸馏防坍缩的首份证据。边界也要讲清:代码未随论文放出,复现暂不可行;三个周期之外的超长迭代行为仍未知,部署前要按自己的周期深度补测。

对搭自进化管线的团队,结合本系列前几篇可以拼出一张完整的风险地图:出题侧防无效与同质(R-Quest),记忆侧防偶然当规律(DAEDALUS 的回放闸门),学习侧防行为漂移(ReSAIL 的冻结锚),经验存储防蒸馏过猛(Learn2Play 存整段的证据),四道闸门各管一段,缺一段就塌一段。自进化不是一门玄学,是一组可以逐项工程化的失效模式。

相关文章

分享: