ByteNoteByteNote
别拿架构师当默认用户,编码助手会虚高
字

字节笔记本

2026年10月10日 · 约 3 分钟读完

别拿架构师当默认用户,编码助手会虚高

API中转
¥120

短补丁基准默认对面是会写代码的人。SWE-Journey 把任务拉长,再换上四种用户人设,看编码助手还会不会问、会不会找、会不会改。论文号 2610.11559,2026-10-08 挂到 arXiv。本轮仓库页搜不到公开代码,作者说流水线以后会开源。数字以论文表为准,不是本轮复现。

问对、找对、改对,缺一就塌

先合成长任务,再让用户活着说话

作者用更强的规划模型从种子仓加一个新角度起草蓝图,再用更弱的实现模型按子任务走:用户请求、对照补丁、失败转通过测试,再补通过转通过测试。难度按上下文范围、改动范围、需求深度、知识宽度至少抬两维。另一家模型打真实性和对齐分,执行不过就重试或重规划。用户风格来自真实聊天日志的五个轴,收成四种角色:非开发、产品经理、新人开发、架构师。用户智能体带着命令行和评测工具,待办、完成、失败之外还有信心分,掉到零就停。评测在同一套容器里在线跑,用户以为某阶段完成才测过程失败转通过,终点再测失败转通过和通过转通过。套件会截断历史。

规模写成三十个实例、五百九十四个子任务、六千三百三十二个失败转通过节点、四千一百六十六个通过转通过节点。对照补丁均值十点二个文件、七百六十八行,大约是现有专业基准的两倍文件、四倍行数。每个实例大约十九点子任务。合成大约五十六美元一个实例。主实验加合成大约一万六千美元。人工短标签对照写成大约一百美元。子任务检查百分之七十七点七能跑通,百分之八点二欠规格被改写,百分之十四点一留下当模型难题。会话均值十八点二八轮,比几份旧基准的五到九轮长一截。

对面换成不会写代码的人,分数就掉下来

十三家模型、四种人设的均值里,架构师终点失败转通过 78.50%,非开发只有 23.00%,产品经理 30.48%,新人开发 35.57%。架构师对非开发的缺口 55.50 个百分点。摘要写成:架构师过百分之七十五的测试,非开发低于百分之二十五。最强一档配架构师能到 93.59%。模型总表里,最强平均分 65.41,最弱 45.37。更便宜的一档成本大约是最强档的六十五分之一。

对面换成不会写代码的人,通过率掉到哪

细项更伤。多数模型提问轮不到百分之二十。最弱一档漏检接近百分之六十。有的模型对已经看见的问题跳过大约百分之十六到十七,其中百分之十三到十四是关键项。过程失败转通过比终点平均低 3.53 个百分点,说明后半段还会补上一点。论文承认成本把规模卡住了,用户智能体只是近似真人,任务可能带着仓库和模型偏好。没有公开仓,就没法按安装步骤复现。若你要的是可下载题集,这篇还不满足;若你要看默认用户换成路人之后分数还会不会好看,数字都在 10-08 那一版里。本轮没有把作者花名册写进正文。

相关文章

分享: