ByteNoteByteNote
别再设一个主脑了,让工人自己领活
字

字节笔记本

2026年10月9日 · 约 3 分钟读完

别再设一个主脑了,让工人自己领活

API中转
¥120

多 agent 常见写法是设一个主脑,再把活派下去。DeLM 反过来:没有主 agent,几份 Codex 或 Claude Code 同时跑,共用一块看板和一张任务队列,各自认领、往上贴发现、最后每人都交一份完整答案。仓库 yuzhenmao/DeLM 用 MIT 开源,论文 arXiv 2606.10662,GitHub 约 166 星。插件仓 Decentralized-LM/delm-agent-plugin 把同一套协作塞进 Codex 和 Claude Code 会话。

评分不是 best-of-n。官方表写的是各份独立提交的平均分。并行换来的是时间和均值,不是「里面总有一个最强的」。

DeLM:没有主脑,只有看板和队列

怎么跑起来

环境要求 Python 3.13、Git、带 BuildKit 的 Linux Docker。先拉一份钉死的任务,再按 harness 建镜像:

bash
python fetch_task.py
python build_task.py --harness claude-code
python delm.py --n 2

--n 4 换四份工人。Codex 用 auth.json,Claude 用 setup-token。--dry-run 只打印计划。跑完用 inspect_run.py 和 reporting.report 看轨迹。额外预留大约 4 GiB 主机内存,再加每名工人的 CPU、内存和磁盘。720 条轨迹放在 Hugging Face 的 yuzhenm/delm-720-trajectories。

认领、发帖、各自交卷

表上的数字怎么读

论文 10 题 Terminal-Bench 4.0 子集、两名工人:相对同款单 agent harness 大约 +12.5 分、1.78 倍。完整 TB 4.0 上,Claude Code 从 81.67%、130.75 分钟到 n=2 的 93.33%、64.77 分钟(2.02 倍),n=4 是 89.17%、52.51 分钟(2.49 倍)。GPT-6 Astra 的 Codex 从 71.67% 到 n=2 的 85%。DeepSWE、SWE-bench Verified(Gemini 3 Flash)、ProgramBench 的隐藏测试也随 n 上升。数字是官方三次重复的均值加减标准差,不是第三方复现。n=4 有时比 n=2 略低,说明人多不一定分更高,但时间往往更短。

适合谁

适合已经能跑 Codex 或 Claude Code 评测、想测「并行工人有没有主脑」的人。不适合当即开即用的桌面产品:Docker、评测任务和密钥都要自己备。仓库还新,插件仓只有约 27 星。如果你嫌单 agent 在长任务上磨太久,先用 --n 2 跑同一份官方任务,看均值和墙钟,再决定要不要四份工人。

相关文章

分享: