
字节笔记本
2026年10月5日 · 约 2 分钟读完
不改模型只改 harness,能让 agent 玩赢游戏吗
agent 能力的天花板到底卡在模型还是卡在外围,这个问题的证据又多了两份。10 月 1 日的两篇 arXiv 论文都选择了不动模型、只改 harness 的路线,一份做视觉交互,一份做视频理解。

VISTA:给多模态模型一双长期眼睛
VISTA(arXiv:2610.02200)的作者阵容里有何恺明,出手就是标杆。论文的判断是多模态模型本身推理能力已经很强,缺的是合适的 harness 把它释放到交互任务上。VISTA 提供长程视觉:模型通过视觉观测感知环境,同时维护一份无损视觉记忆,过去的观测以原始形态全量保留,推理时可以检索、重组。
成绩单很硬:在 ARC-AGI-3 上,Claude Opus 5.0 借助 VISTA 把相对人类动作效率从 40.68 提到 100.00 满分,25 个公开局全部通关,动作数比首次游玩的人类少 57.4%;在另外三个视觉游戏与谜题基准上以极小适配泛化取胜。摘要页未见代码链接。
VideoEvolve:让 harness 自己进化
VideoEvolve(arXiv:2610.01766)处理视频时序定位:用自然语言查视频里事件发生的时间段。模型冻结的前提下,harness 决定查询如何引导时间预测、预测如何被精修,而手工精修要人肉诊断失败模式再协调改动。作者的方案是让 harness 自动进化:填空式的表示法固定各阶段接口、放开工作流与指令的演化空间,分支引导的进化策略保留有希望的代码分支,由执行反馈与验证集指路。

组件分析里有个值得记住的结论:指令精炼带来的是一致增益,进化出的代码却时灵时不灵。想快速涨点,先磨提示词。代码开源在 github.com/bingjunluo/VideoEvolve。
放在一起读
加上此前写过的 Mingbird 与 Jev 分工线,这已经是第四组指向同一结论的论文:harness 层的设计空间远没有挖完。对工程团队的直接启示是,升级模型之前,先把记忆结构、指令质量与工作流结构这几件便宜的事做完。

