ByteNoteByteNote
三步把技能库收成六张还能涨分
字

字节笔记本

2026年10月10日 · 约 2 分钟读完

三步把技能库收成六张还能涨分

API中转
¥120

给模型塞技能卡,检索常按语义相似度来。这篇先记下一轮蒸馏里谁真在教,再只留后期还在贡献的那几张。方法写成 SGUID。论文号 2610.12367,2026-10-08 挂到 arXiv。本轮没有项目仓,作者写接受后放代码。数字以论文表为准,不是本轮复现。

检索到的技能,不到四分一真能教

三步:记信号、筛后期、只留六张再蒸

第一步先用全库跑一轮蒸馏,按技能记下检索次数和带符号的系数。系数来自校验器和门控,对不上就翻号。第二步只留早期帮过忙、后期至少十次正向、后期比率掉得没有早期那么快的卡。第三步按后期正向次数取前六张,平局看后期比率,从同一检查点再蒸一遍。第二轮再收成三张。检索用六亿参嵌入的余弦。

对照写成只看答案对错的强化、师生同权的在线自蒸馏,以及检索到技能再给老师看的带门控蒸馏。训练题是一点七万条数学卷。评测三套竞赛卷,指标是十二次平均,取两百步里最好的检查点。四档骨架:七十亿、十七亿、四十亿、八十亿。

全库分别三十八、三十四、三十、七十一张,最大大约十一倍。检索日志里,真能提供蒸馏信号的只有 21.2%、19.7%、6.4%,作者写成不到四分一。

六张对上七十一张全库,八十亿档均分还能再涨

六张卡对上全库,八十亿档从六十四到六十六

八十亿档均分:基座 62.9,只看答案 63.4,全库 63.9,筛选第一轮 64.3,第二轮 66.3。四十亿档筛选两轮 65.1 和 65.2,基座 62.1。七十亿档两轮 40.9 和 41.3。竞赛卷那一栏,不筛直接更新会掉 0.3 个点;筛选先加 0.5,再加 1.1。四十亿档上,两张 63.3,四张 64.4,六张 65.1,十二张 64.6;不持久化掉到 62.3。

技能卡是短的手续、启发式或失败模式,从当前策略已校验的轨迹里摘,不是更强老师外挂。题型包括三角不等式、同余、计数、几何约束、不定方程和对称。二十五步代理筛和整轮蒸,十七亿档均分 42.5 对 42.3,四十亿档 63.4 对 65.1,短代理在小模型上够用,大一档仍要看整轮。随机六张和最差六张都矮过按动态挑的前六张,说明张数对了还不够,还得看谁在后期还教得动。论文写接受后放代码、提示词和候选库。若你要的是可下载技能包,这篇还不满足;若你要按训练动态收技能库,数字都在 10-08 那一版里。本轮没有把作者花名册写进正文。

相关文章

分享: