
字节笔记本
2026年10月6日 · 约 2 分钟读完
快判断交给专门的模型
搜索 agent 每一步都在做小判断:这条结果相关吗、证据够了吗、下一步搜什么。用生成式大模型做这些判断,又慢、给出的置信度又不可靠。今日 Hugging Face 论文榜的 SearchJev(arXiv:2610.05107,9 赞)把这个病灶切了出来。

System-1 决策器怎么造
SearchJev 是个快速且校准的 System-1 模型:输入搜索状态加决策模式,直接给合法选项打分,完全不走自回归生成。训练用 SLCD 软标签学习,在不确定监督下学出决策概率并校准置信。配套的 SearchDecision-Bench 覆盖六类决策。
数字说话:决策质量胜过同规模 Qwen3.5 自回归模型,速度快 5.2 至 5.3 倍,期望校准误差降 41 至 74 个百分点。装进双系统 agent 后,System-1 管快判断,拿不准的交给 System-2,规划、查询生成与答案组织仍由后者负责。BrowseComp-Plus 上活跃搜索时间提速 3.7 至 4.7 倍,准确率从 45 反升至最高 54。这与站内决策模型生态一文判断完全咬合:llama.cpp 加了 systemone 端点、Kev 开了 GGUF,现在搜索场景也有了专门的 System-1 实现,便宜高频的判断正在被独立品类接管。页面未见代码链接。
RobotUse:机器人 agent 的剧本

同榜 10 赞的 RobotUse(arXiv:2610.04929,KAIST 与首尔大学团队)处理物理世界的同类问题:计算、上下文与决策怎么分层。agent 视觉上挑目标与位姿,后端管几何、运动规划与控制,子代理处理子目标细节,一份持久剧本让 agent 从执行反馈里持续学习。
RoboLab 基准上任务成功率 45,胜过 CaP-X 6.7 个百分点,且决策上下文保持紧凑。更实用的是它能从真实世界执行的不完美反馈中学习并迁移到后续任务。项目页 robotuse-team.github.io 已开放。
放在一起读
一个把搜索 agent 的小决策提速降耗,一个把机器人 agent 的经验沉淀成剧本。两篇的公约数还是那句:判断分层,各归其位。



