
字节笔记本
2026年10月10日 · 约 3 分钟读完
对话过了关,本地数据工程分数仍是虚的
对话过了关,本地数据工程分数仍是虚的
本地模型在对话框里把出行数据工程题答完,看起来像过关。关上工作区再跑同一套隐藏检查器,分数会掉一截。阿利坎特一组评测把十五道可复现题配上十套本地配置,每格五次,一共 1500 次。工作区相对纯对话,把通过率抬高 26.7 到 52.0 个百分点。最强的一档闭环通过 85.3%,量化 9B 也能到 69.3%,显存大约 6.5 GB。一次对话变绿,说明不了它会自己找证据。
论文编号 2610.11482。题面覆盖发现与连接器、时刻表、维基式补全、特征与分析和校验报告五组。模型是两代本地系列的 2B 到 35B 混合专家,权重量化为主,2B、4B、9B 另跑半精度对照。硬件是一块 24 GB 加速卡。闭环给读、写、改、命令行和提交五件工具,解码温度 0.6。上限是 1000 轮、1 小时、单条命令 60 秒;协议失败 8 次、同一失败调用 8 次或完全相同调用 20 次就停。离线快照含 5373 条统计值、160 个指标、26 行目录、时刻表 81 或 80 或 180,以及 51 个兴趣点。复现包公开在开放科学档案。

看得见中间文件,分数才按档站住
量化闭环、每档 75 次:2B 通过 2.7%,中位 12.3 秒、5 次工具;4B 37.3%,12.3 秒、7 次;9B 69.3%,10.5 秒、7 次。上一代 27B 是 74.7%,29.9 秒、9 次;上一代混合专家 77.3%,9.6 秒、7 次。新一代 27B 是 85.3%,31.3 秒、8 次;新一代混合专家 81.3%,14.7 秒、8 次。半精度对照里,2B、4B、9B 是 1.3%、57.3%、66.7%,相对量化分别负 1.3、正 20.0、负 2.7 个百分点。纯对话更虚:2B 0%,9B 量化 17.3%,新一代大约 44% 到 48%。
工作区相对对话的提升是 2B 加 2.7,4B 加 26.7,9B 加 52.0,上一代 27B 与混合专家加 36.0 与 37.3,新一代加 41.3 与 33.3。除开 2B,都落在 26.7 到 52.0 个百分点。T08 单次对话 0 过 50,闭环 37 过 50。T01 则是 4 过 50 对 9 过 50。不少于 9B 的量化闭环上,T09 全过,T02、T06、T08、T11 不少于 96%。更难的是 T01、T13、T14。小模型先在协议、模式和循环上散掉;做大之后剩的是逻辑和格式,以及工具报错后原地打转。

过关应先卡自检,再谈参数量
观点很直接。本地数据工程值不值得上桌,要看模型在只看得见编译、运行和中间文件时能不能自己收敛,而不是看对话框里一次答对。新一代 27B 把准确率顶到 85.3%,混合专家更快,量化 9B 是还能过半数的小档。作者写明,即便最强档也要靠确定性检查器托底。复现应先卡闭环自检这一档,再去碰半精度和纯对话。只报对话通过率,等于把工作区替它找回的那一截写成了模型自己会。报告应把对话、闭环和半精度三档并排,再写那次过关到底靠谁。



