
字节笔记本
2026年10月7日 · 约 2 分钟读完
推理靠挑不靠写,技能进化留证据
今日 Hugging Face 论文榜的两篇高位新作,一篇管推理的形态,一篇管技能的账本,都在把 agent 的软成本往下压。

SSR:推理从作文题变成选择题
小模型做多模态 agent 时常有一个尴尬:动作之前先写一大段自由推理,写得很长却对下一步动作没什么指导价值,推理成本倒是实打实地付了。Feiyu Gavin Zhu 等十二位作者的选择式结构推理 SSR(arXiv:2610.01892,今日榜第 2 位)把形态整个换掉:高频出现的高层推理思路预先存成一组可复用的自然语言候选,模型不再生成而是按上下文似然挑一个。
妙处在打分方式:候选是预置的,可以用 teacher-forced 预填充配合共享 KV 缓存并行算似然,不需要任何辅助任务头。七个多模态搜索基准、2B 与 4B 模型、强化学习与监督微调双路线下,成功率保持竞争力,单轮推理延迟降九成以上,每题总推理延迟省 28 至 54 个百分点。这与站内刚写过的 SearchJev 是同一路数:快判断交给便宜的结构,生成只留给真正需要的环节。项目页已开放。
EVISKILL:技能编辑要有据可查

Yan Zhou 等人的 EVISKILL(arXiv:2610.05030,7 赞)处理经验驱动技能进化的两处老伤:编辑一旦落盘,背后的行为证据就丢了,出错难溯源;全局校验又可能错杀局部有依据的修正。方案分三步:执行观察组织成可回放证据卡,每次技能编辑都挂上支撑上下文;用定向重执行验证编辑效果并取反馈;有证据支撑的编辑先跨轮次保留,等全局校验通过才并入正式技能。三个交互基准、六个底座上验证。页面未见代码链接。
放在一起读
一篇省推理的钱,一篇管进化的账。加上此前写过的 VERA 共同进化与 Pivot-SD 落子训练,agent 的技能生命周期从获取、验证到维护,每一段都在被单独优化。



