
字节笔记本
2026年10月11日 · 约 3 分钟读完
开源追旗舰的账,这次算在推理开销上
开源追旗舰的账,这次算在推理开销上
开权重模型追旗舰,通常追的是榜单分。Reflection AI 十月五号官宣的 Beam 换了个算法:501B 总参、23B 激活的稀疏混合专家,编码推理三线成绩进第一梯队,卖点是同档任务对一款旗舰省 3 到 4 倍推理算力。权重、技术报告和模型卡本月内按 Apache 2.0 放出,现在先走小范围 Early Access。开源阵营补上了一个纯文本的重装选手。
官方博客把训练账单写得很细。预训练 23.8 万亿 token,用 6144 组 NVL72 机柜端到端跑了不到四周,后期有效算力还有 92.3%。强化学习单独一轮:1.05 万块 GB300 再跑四周,滚动超过 1 亿次,上下文封顶 256K,中期训练再延到 1M。安全侧没有挤在一起训,而是两条管线分开走,再用多教师在线蒸馏合并。

分数进第一梯队,短板也写明
编码与终端线:SWE-bench Verified 80.9,SWE Bench Pro v1 65.5,更难的 v2-Hard 77.2,终端基准 2.1 是 80.1,DeepSWE 44.4。推理线:AIME 2026 拿了 97.8,GPQA Diamond 90.5,不挂工具的人类末考 36.2。工具线:MCP Atlas 78.7,带上下文管理的浏览基准 77.4,银行场景智能体基准 38.0。作者没有只报喜:明说原始能力仍落后于 Kimi K3,定位是对标另一款旗舰同时把推理账单砍掉大半。文本单模态,也写在明处。
这批数字要按同源读:分数全部来自官方博客,尚无第三方复测。文中提到结果在十月八号更新过一轮,读的时候以博客为准。真正可核的硬承诺是许可证和时间点:Apache 2.0,本月内放权重加全套运行评测微调组件。此前开源重装模型多为研究许可或延迟放权,这次把许可证先写死,含金量就在兑现上。

推理开销,才是这代开源的胜负手
观点很直接。开源模型追旗舰,分数追平只是入场券,用户真正的成本在推理:激活参数小、KV 更省、单卡能承接的并发才决定能不能进生产。Beam 把 23B 激活和省 3 到 4 倍算力写进卖点,等于承认这条赛道比的是账单。对自建团队,等权重放出后要先算两笔账:一是同样任务在不同模型上的实际 token 与时延,二是私有化部署后吞吐能不能撑住业务峰值。只看榜单分就迁移,账单会替你重新选一次。
时间线很清楚:现在是 Early Access 等位,权重与技术报告本月内随 Apache 2.0 放出。复现应从官方技术报告进,逐项对着训练配置核;分数复测则等权重落地后再跑。开源阵营这轮补的不只是一个 501B,是把兑现节奏也算进了发布策略。



