
字节笔记本
2026年10月10日 · 约 2 分钟读完
三步把用过的经验收进一棵消息树
对话一长,旧细节不是把窗口撑满,就是被整段删掉。Hippocam 不另开一套打分库,它把交互史本身当成记忆:用过的再写一遍,没用过的收成前缀。论文号 2610.12124,2026-10-08 挂到 arXiv。本轮仓库页搜不到公开代码,数字以论文表为准,不是本轮复现。

先认意图,再决定留还是收
作者给每段对话叠一层意图栈:继续、加深、关闭、换题。关掉的意图会被沉淀成第一人称的结果、状态、证据和教训。更早的段落再递归收成叙述,外加还没绑死的事实。原文并不扔,而是挂在一棵消息树上,召回工具可以一层层展开,直到细节够用。召回过的知识会再巩固,没被点到的前缀继续变短。权重全程不动。
默认窗口十二万八千,压力线八成,容量顶满一倍,单次至少压掉八千一百九十二。底座写成一百万窗口的快模型,打分用更强一档。对照是纯上下文、分层智能体、两家记忆库、操作系统式记忆、推理银行、玩法本,以及另一家长记忆智能体。论文写明:单次运行,算力和辅助预算没有对齐。
长对话能记住,交错任务也不掉
家居操作、科学世界、流式一百五十题的均值,完整方法写成 97.8、81.9、81.7。玩法本在科学世界上更高,是 91.9。流式题从一百五十扩到三百,完整方法均值 81.7 到 85.8。长对话裁判分 77.6,对照记忆库 67.5,另一家 58.0,操作系统式 51.7。时间跨度题 86.6,对抗题 87.2,多跳只有 40.8。

迁移表里,家居冻住后迁到科学世界,完整方法从 55.9 到 75.1,加 19.2 个百分点。热点问答迁到事实验证,加 6.0 个百分点。交错任务上,隔离 85.1,交错 88.7,没有掉下去。去掉意图条件,交错从 88.7 掉到 65.6,填充比例从百分之十四升到百分之六十三。去掉前缀,工具题 78.7 掉到 65.7,上下文从大约一点九七万升到五点零七万。
论文承认单次运行、算力不对齐,科学世界低于玩法本,超长冲突题在六万四窗口上只有百分之四十一。沉淀有时会丢掉更新,或留下过时事实。没有公开仓,就没法按安装步骤复现。若你要的是可下载记忆库,这篇还不满足;若你要看用过的留下、没用的收短会不会比整段删除稳,数字都在 10-08 那一版里。本轮没有把作者花名册写进正文。



