ByteNoteByteNote
别把没过线的候选直接扔掉
字

字节笔记本

2026年10月10日 · 约 4 分钟读完

别把没过线的候选直接扔掉

API中转
¥120

标准自动进化环里,候选没过线就丢掉。Mara Chain 把这些失败者当成跳板,沿一条有上限的细化链再改。论文号 2609.35855,2026-09-25 挂到 arXiv。公开仓 ant-research/AntOmniEvo 本轮约 1.1k 星,许可 Apache-2.0。HF 日榜已不在前十五,热度以仓库页和论文表为准,不是本轮复现。

没过线的候选先沿链再改

丢掉的候选,往往还留着线索

作者要优化的不是权重,而是已经上线的技能、套件、流水线和一小段代码。常规环提出、打分、只留赢家。论文认为被丢掉的选项里,常常藏着后面步骤才用得上的信号。

Mara Chain 的外环维持一个池。按多维领导次数挑父代,在一小批上跑,再提案。子代比父代高出阈值,才拿到验证集。否则开一条固定深度的血缘链,默认深度五步,把轨迹、残差、分析和改动日志一起留下。链上任一后代过线就提前停,否则整条丢掉。验证之后先按弱帕累托丢掉被支配的向量,再按验证分均值留前三名。并行槽共用一个池,提案拆成分析再改写两段。

公开仓把可调文件目录当成基因组。你要一次交齐五样:怎么跑单条评估、零到一的打分器、训练和验证数据、把工件映到目录的模式,以及起始文件。框架管调度、预算、筛选和可中断的存储。提案器是会改文件的编码智能体。系统本身不必带大模型。评估必须能复现,而且不能贵到一轮都跑不起。只调几个标量、评估几乎不可复现,或者必须留下严格合规审计时,文档建议别用这套环。

少跑很多轮,分数还能再抬

AppWorld 585 题,168 道普通、417 道挑战。完整方法在普通集任务完成率和场景完成率写成 89.9 和 83.9,挑战集 76.7 和 59.0。空技能基线是 48.2、35.7、33.3、19.4。相对 GEPA、ACE、SkillOpt-Lite,最高相对抬 20.5%。跨模型平均四项增量:GLM-5 加 40.3 个百分点,DeepSeek-V4-Pro 加 32.7,Qwen3.5-397B-A17B 加 23.4。

验证分到 0.8 时,完整方法用 3280 次滚动,GEPA 要 9514 次,少 65.5%;墙钟 11.9 小时对 35.8 小时;终点 0.87 对 0.805。ACE 和 SkillOpt-Lite 没摸到 0.8。消融到验证 0.79:完整 2356 次,去掉链 3480 次,去掉前三名筛选 5388 次。

空技能到完整方法的平均抬升

TerminalBench 2.1 共 89 题,通过率 71.9%。对照 AHE、Codex、Kira 的 51.7%,高 20.2 个百分点;对照 Meta-Harness、OpenCode 的 49.4%,高 22.5 个百分点。去掉链条只剩 57.3%。论文也写相对这些套件方法高 39.1%。注意这张榜是样本内,没有划出持有集。

MuSiQue 四跳检索,测试集十分位折损累计增益和十分位召回,相对手写流水线分别加 0.104 和 0.131。去掉链条后测试集两项要低 0.034 和 0.039。训练、验证、测试划分写成 300、100、300。

安装写成 Python 3.10 以上,进仓后可编辑安装,可视化器还要再装一套前端依赖。示例脚本只给结构,路径和外部仓要自己换。提案器走外部命令行智能体。论文承认小批诊断会过拟合,诊断上下文是手写的第一刀,TerminalBench 指标不是持有集。本轮没有把作者花名册写进正文。数字以 09-25 那一版论文和本轮仓库页为准。

相关文章

分享: