
字节笔记本
2026年10月9日 · 约 5 分钟读完
编码 agent 跑偏时,不该用整段重算来巡检
编码 agent 每走一步都去全量比对历史成功轨迹,巡检本身就会先把预算吃掉。arXiv 2026-10-08 的 OnTrack 把监视写成前缀图:每条事件一个节点,后面步骤用到产物就连边。生长中的有向无环图用流式不平衡融合 Gromov-Wasserstein 对齐到可选的参考跑,节点代价加结构。裁决是继续、警告或停下,不是固定打分。访问可以从参考加模式缩到只有模式,再缩到只看事件流。本轮没有找到公开代码仓。论文写代码、配置和结果 JSON 随文放出,HTML 页没有给出仓库地址。协议是 CC BY-NC-ND 4.0。
延迟写成大约每步一毫秒。苹果 M5 Max 上,t=m=40、K=3 时 p50 0.85 毫秒、p95 1.6 毫秒;规模 20 时大约 0.5 / 0.7 毫秒;t=80 时大约 1.6 / 3.9 毫秒;升级求解大约 30 毫秒。流末差距不超过 0.013。这些是论文表,不是本轮复现。

先分层,再谈打断
第一层永远在:环、停住、信息增益过低。第二层要参考:传输泄漏、覆盖、反转检查。第三层看模式,不可逆调用若缺前置或单行提案对不上,就挡住。流式修正包括:每节点质量恒定,免得前缀因为还短被罚;参考质量按前沿遮罩;每个事件先做一步热的共轭梯度或 Sinkhorn,完整求解只在干预前;年轻节点的结构权重爬坡;晚到的边就地补。代价混合写成 0.45、0.20、0.35。阈值 theta 0.35,epsilon 0.05,选中的 lambda 0.3,校准 AUROC 0.743。软最小 tau 0.05。kappa 0.3,beta_look 0.3,eps_nu 0.01。共轭混合 gamma 0.7。内层 Sinkhorn 默认 5。年龄窗 3。泄漏阈 0.6。宽限 3。探索预算 25%。
受控实验写 8 个场景加 40 乘 7 的战役。环召回 100%、延迟 0;幻觉 100%、延迟 2;反转 94.1%。200 次良性里 0 次误干预。真实轨迹组件 n=40 / 30,环和停住的 AUPRC 0.70 到 0.74。论文把自己写成过程监视器,不是先知,也不是结果预测器。

数字绑在哪几条轨迹上
SWE-bench 实验用数据集 sailplane/swe-agent-trajs:2294 条轨迹,可用 2288,其中 430 已解决、1858 未解决。按实例切开,种子 42:校准 228、参考 5、其余评测。嵌入 all-MiniLM-L6-v2。评测看前 k 步。打断看 6 步窗里的严重旗密度。部分 AUROC 在 k=5 / 8 / 10 / 15 / 20:OnTrack 0.612 / 0.631 / 0.622 / 0.635 / 0.648,余弦 0.552 / 0.574 / 0.589 / 0.633 / 0.646。八步处相对相似度方法大约加 0.057 AUROC。打断阈 0.60:真停 23.3%、误停 20.7%,节省大约 17.9% 算力,依赖精度大约 83%。论文另写成省大约 18% 本会烧在失败路上的算力,被打断的 6 次里 5 次真的在失败,83%。退出状态 AUROC 大约 0.979。结果 AUROC 大约 0.581,长度对齐后大约 0.526。拼接 AUC 大约 0.546。
限制也写死了。分布内拼接接近随机。抽取有噪声。展示的打断点有 13% 到 21% 误停。Gromov-Wasserstein 项在同质的 SWE-agent 模板上偏弱。没有跟踪误差定理。参考集只有 5 个实例。不要把 18% 理解成任意仓库都能省。Cadence 看的是该不该用固定巡检,ViSkill 看视觉技能卡,三篇可以并排,不要并成一篇。本轮打开的是 2610.12375v1 的 HTML,没有公开安装入口。
读这篇记住三组约束。一,每步大约一毫秒,数字绑在 M5 Max 表上。二,加 0.057 AUROC 和大约 18% 算力绑在 5 条参考和那份 SWE-agent 轨迹上。三,它是过程监视,不是结果预言。站内没有公开仓可 clone,就不要写安装步骤。Pyramid-JiT 今日 HN 新帖只有 5 星,不并进。gh-stack 的工作树是 Git 目录,不是轨迹图。HF 日榜仍是昨天的 AgentGarten 和 TokenRouter,那两篇站内已有。没有公开安装入口,就不要把论文公式抄成可运行脚本。



