ByteNoteByteNote
三步把墙上时钟接进智能体
字

字节笔记本

2026年10月11日 · 约 3 分钟读完

三步把墙上时钟接进智能体

API中转
¥120

三步把墙上时钟接进智能体

给编码智能体写一句预算十五分钟,多数时候等于没写。一项将被 NeurIPS 2026 资源感知智能体研讨会接收的评测量了这件事:只把预算写进提示词,智能体在 15 分钟档的守时率只有 15%,平均用到预算的 161%,到点靠外力掐断。接上信息时钟再层层加码,守时率能爬到 88%,而分数纹丝不动。会停只是第一步,会用才是第二段。

论文编号 2610.10833,许可署名非商业相同方式共享 4.0。一套是五道机器学习工程题配 27B 级本地模型,另一套是文字冒险游戏配 4B 模型。题面故意不给时间信号:没有挂钟工具,模型对动作耗时几乎没概念,只能一路跑到外层按两倍预算强杀。

同一道题,守时率从 15% 爬到 88%

第一步:让模型看见钟

先别谈惩罚,把时间读数接进上下文。加一个时钟工具后,超支从预算的 161% 压到 99.7%,压到几乎贴线;在 15 分钟档,守时率从 15% 抬到 62%。代价几乎为零:榜单分从 47.5 到 47.0,统计上不算数,有效率反而从 78% 升到 88%。单独在文字冒险题上,自动时钟对预算的贴合最好,16 秒档实测约 14.2 秒。

只给读数还不够稳。时钟加截断,守时率 74%;时钟加硬拒绝,也就是到点后工具调用直接被拒,守时率 88%。拒绝档的分数略低于截断档,有效率也从 90% 掉回 78%,说明模型在最后一段里摸索得多、浪费也多。这一步的要点是:钟要能被读,越界要会被拒。

第二步:用强化学习收尾差

拒绝加强化学习,把守时当成可训练目标。评测里这组在 15 分钟档守时 86%,实际用量落在预算的 87% 到 93%。在文字冒险题上更明显:训练前得分接近 0,训完 16 秒档拿到约 46.4 分,停机误差小到 0.2 秒,换没见过的预算档位也贴得住。作者的原话是:把时间预算写进提示词并不够,信息时钟才能把超支压到接近零。

守时解决了,多出来的分钟没换来分数

第三步:承认守时不等于产能

守时抬上去了,产出没跟上。榜单分数在钟和拒绝之间没有上升趋势;把多档预算混在一起训练,策略直接塌向最短预算的打法,剩下的时间用无意义的占步动作填满。逐级给奖能拿到 96% 的准点停机,分数却只有 22.5。作者把这写成守时与产能之间的缺口:遵守约束好解决,把富余时间换成分数是另一个问题。

观点很直接。给自己的智能体接时钟,顺序是先给读数、再给硬边界、最后才谈训练;指望提示词里一句话管住节奏,实测只会超支六成。复现这套结论没有公开仓库,数字以论文表格为准,许可限制商用。报告时把守时率和分数并排写,别只写会停。至于多出来的分钟怎么变成产出,论文把它留成了开放题。

相关文章

分享: