
字节笔记本
2026年10月9日 · 约 3 分钟读完
竞赛队换小模型时,先看清金牌线和那份特化配方
竞赛队把通用大模型直接丢进编程或数学试卷,第一轮搜索常常看起来能写,分数却停在铜牌附近。英伟达实验室在 2026-10-07 的博文 Fine-Tuning Nemotron for IOI and IMO 里写,他们把同一家族做成竞赛特化,再配上可复现的推理配方。国际信息学奥林匹克 2026 写成 535.4 分,满分 600,金牌线 361.12,人类最高 498.27。国际数学奥林匹克 2026 写成 30 分,满分 42,金牌线 29。这些是官方口径,不是本轮复现。
编码特化仓在 Hugging Face,总参 5500 亿、激活 550 亿,混合专家,上下文 262144,权重量化成 NVFP4。许可是 OpenMDW 1.1。模型卡写,它从同一架构的教师权做一轮监督微调,用了 477642 条轨迹、22000 道竞赛题,推理时常和迭代修正一起用。本月下载写成 443。博文还写了 2025 年信息学轨迹:三十亿激活那一档从 130 到监督微调 280、强化学习 291、再加生成修正到 468,当年金牌线 438.3;更大的编码特化到 502。

配方在哪,怎么接到现有推理栈
数学这边单独有一个集合页,里面有监督微调和强化学习检查点、证明数据集,以及一张奥林匹克基准。博文写监督微调 414890 条、15818 道题,强化学习 9597 道题。配方和推理管线放在 NeMo Skills 仓库,许可证 Apache-2.0。本轮核到一千零四十八星、二百零九次派生,最近推送 2026-10-09。仓库定位是提高大模型技能:合成数据、训练和评测可以先在本机跑,改一行配置再上集群作业系统。推理可走接口、本机服务或大批作业,后端包括多种服务引擎。
模型卡推荐的服务栈是一款支持该量化格式的推理引擎,容器版本写成 v0.22.0,键值缓存用低精度,推测解码步数写成 5,张量并行举例是四路,最大长度 262144。也写了另一套服务引擎和容器运行器。客户端走兼容接口的聊天补全,温度 1.0、核采样 0.95。这是竞赛特化,不是通用客服模型。博文原句写,监督微调检查点在第一轮搜索最强,两套特化的长处互补,希望结果能用在竞赛以外。

读这篇记住三件事。分数是官方赛场口径,不要写成你本机也能打出金牌。权重大、许可也不是阿帕奇那一套,落地前先读 OpenMDW。配方仓库才是可复用的工程件:同一套技能流水线还能跑数学、代码和工具评测,不只为两场奥林匹克服务。若只是要一个能在笔记本上玩的编码助手,这套体量不对;若已经在跑该家族的推理栈,可以把竞赛配方当成一份公开的特化说明书。



