
字节笔记本
2026年10月10日 · 约 3 分钟读完
当绿灯提交交上来,评审却问这单谁负责
当绿灯提交交上来,评审却问这单谁负责
持续集成已经绿了,智能体提交还是会被人先问一句:这单谁负责。一项面向评审的调查把这种缺口写成可评审性债务:缺理由、缺验证、缺所有权。样本是 31 个国家的 239 人,78.2% 审过不少于 10 单智能体提交,62.8% 超过 20 单,49.4% 超过 40 单。沟通方式变了的占 90.8%,觉得要审的单更多了的占 77.8%,其中中度或显著 57.7%。作者写明,智能体署名本身不是一律拒收的信号。
论文编号 2610.11179,许可署名 4.0。招募对照了一份智能体提交清单,再覆盖 133 个基金会项目和 49 个公开项目。开放评论里,195 人写沟通变化,200 人写实际做法。沟通主题里,先验证的占 60.0%,缺意图的占 37.9%,所有权占 28.7%,语气 27.7%。做法里,主动验证 62.5%,设门槛 59.5%,管带宽 45.0%,用模型做分流只有 9.0%。低努力新来者提交被看成问题的占 60.7%,其中重大问题 25.9%。

同样是绿灯,往下看的人少了一截
成对题目问的是:持续集成已过,还愿不愿意不加额外说明就继续。清理从 86.2% 降到 73.6%,文档从 85.4% 降到 66.9%,测试从 79.5% 降到 61.5%,无行为重构从 52.3% 掉到 19.7%。性能从 23.0% 降到 12.1%,并发从 12.1% 到 11.3%,鉴权从 8.4% 到 5.4%,复杂功能从 11.7% 到 7.5%。八组比较校正后都显著。智能体提交里,测试题愿往下看的是 81 对 39,重构是 146 对 21。
进门条件最常被点的是持续集成和测试,66.5%;描述把意图写清楚,56.9%;认识提交人,41.8%;有人认领,32.2%。推迟最狠的是空泛的模型风描述,64.9%;大补丁没拆和缺测试各 51.0%;没上下文 46.4%;持续集成没修 39.7%。对疑似路过的新来者,80.8% 会另眼看待,55.6% 要求对方证明自己看懂了改动,38.1% 要求先有议题。最能建立信任的是专业回复 82.4%,以及测试超出能跑的 81.2%,范围收敛 77.8%。

规则先卡证据,再谈公平
171 条可整理的规则建议里,模型使用和准入占 36.8%,按风险要证据占 33.3%,排队上限 17.5%,按负责人分流 15.2%,把差分关在可控范围 14.0%。公平议题里,128 人写得到负担不对称:管护 60.9%,对等往来 57.0%,可审计 45.3%,把活推给工具 43.0%。讨论里有两句被写死:省作者十分钟、耗评审一小时,就不公平;审的是提交人的活,不是模型吐出来的字。
场景很具体。智能体把清理和文档一次交齐,持续集成也绿,评审仍可能先找意图、验证和认领。缺这三项,绿灯只证明构建过了,不证明这单有人扛。复现这条调查,应先看成对意愿度和推迟清单,再决定模板里要强制哪几栏。只报通过率,评审成本就会被漏记。



