ByteNoteByteNote
评测分掉了,不该先怪智能体
字

字节笔记本

2026年10月10日 · 约 2 分钟读完

评测分掉了,不该先怪智能体

API中转
¥120

智能体评测一掉分,第一反应常是模型或套件不行。这篇把尺子本身拉出来压:同一条轨迹换包装、换名字、再跑一遍,看翻的是智能体还是测量。方法写成 TRACE。论文号 2610.11678,2026-10-08 挂到 arXiv。配套仓本轮核到零星,协议页写署名非商用相同方式共享。数字以论文表为准,不是本轮复现。

换包装几乎不翻盘,不代表两家裁判看法一样

换包装几乎不翻,换裁判就对不上

合成研究运维环境写了二十五道题,智能体要取文档、改配置、跑模拟实验、查日志、交报告。公开柜台基准冻住六加三十道,后来八十八道未见过;另有一百零八道通信向探索。原生校验器之外,再加两家单次调用的大模型裁判,盯冻住的轨迹。

一百一十八条原轨迹上,重复跑和改工具名各 0 次翻盘,改观察格式 1 次。两家裁判对原生结果:一家一致 95%,系数 0.89;另一家一致 38%,系数 0.09。同一批记录上,两家互相不一致 57%。一家自己对同一条再判,有 3.7% 对不上。作者的意思是:包装稳,不等于裁判稳。

同一批记录,两家裁判对不上的超过一半

分掉了,先分清是谁的锅

意思不变的改写,八对智能体乘改动里有七对奖励波动落在正负 0.10 里,有一档格式改动写了不确定。把域名打乱、标签骗人但题仍能做时,四档智能体奖励掉 0.196 到 0.437,区间都不含零。完全相同的原轨迹再跑,三档翻盘 14.7% 到 16.3%,有一档 35.6%。八十八道、三轮的主表里,七对等价改写仍被标成等价。

四档智能体写成两家内测快档、一档低精度内测和一档公开快档,正文不写花名。误导命名对照里,四档分别掉 0.227、0.226、0.437、0.196,样本大约一百五十四到一百五十八。意思不变的改名有一档奖励从 0.500 到 0.767,作者仍把它放在测量扰动里看,不当成能力跃迁。公开柜台后来还写了一百五十八道可用里的八十八道未见过。仓里有合成环境和柜台工具的压测脚本,星数仍是零,页上没另写许可证,论文本身写的是署名非商用相同方式共享。论文把这条线和智能体分数拆开:分数变了,先问尺子,再问套件。若你要的是现成评测平台,这篇还不满足;若你要看掉分该不该先怪智能体,数字都在 10-08 那一版里。本轮没有把作者花名册写进正文。

相关文章

分享: