对话过了关,本地数据工程分数仍是虚的
本地模型在对话框里答完出行数据工程题,分数仍可能是虚的。1500 次试验里,工作区把通过率抬高 26.7 到 52.0 个百分点。最强档闭环过 85.3%,量化 9B 过 69.3%。先看现场自检档。

发现 AI Agent、开发工具、开源项目与效率软件,跟上每日科技与工程实践。
编辑精选
生产事故排障要同时读日志、指标、链路、手册和部署记录,人脑切换成本极高。Tracer-Cloud 开源 OpenSRE:11.6k 星、Apache 2.0,60 多个集成,证据驱动定位根因,标识符先脱敏再出网,还想当 SRE 界的 SWE-bench。

本地模型在对话框里答完出行数据工程题,分数仍可能是虚的。1500 次试验里,工作区把通过率抬高 26.7 到 52.0 个百分点。最强档闭环过 85.3%,量化 9B 过 69.3%。先看现场自检档。

编码智能体把官方单测跑绿,评测单就会写成解决了。TestJack 在 8862 次运行里推翻 1545 次所谓正确,总解决率从 50.6% 掉到 33.2%。先问官方测试挡住了什么,再谈那条高分还在不在。

31 国 239 名评审里,持续集成已绿时无行为重构还愿往下看的人从 52.3% 掉到 19.7%。缺理由、验证和认领的时候,绿灯只证明构建过了,并不能证明这单真的有人在扛。

同一套可执行仓被拆成空仓、骨架、文件、函数四档。仓库级全过最高只有 31.0%,文件级能到 76.7%。函数绿了不等于整仓交得出去,评测单常把这个缺口悄悄抹平。

固件智能体改完还要过现场传感、时序和安全联锁。闭环评测 420 次试验里,主设置 gpt-5.4 过 14 次,本地 27B 过 9 次,一次提交变绿说明不了它会自己找证据。先看自检档。

工具智能体自己决定这一轮看见哪些官方观察。SSCBench 在 1191 次故障运行里仍报得出采纳率,可 44 次最终看得见反证的采纳里只有 17 次赶在首次使用前到场。先问时机,再谈失败。

编码智能体只看当前工作树,会漏掉已经合并的约束。Chronos 不微调,只在测试时把历史拉取请求做成经验卡;六套骨干在 SWE-Bench Verified 上均分从 69.2% 提到 72.9%,人工复核有用卡也接近翻倍。

技能包在 GitHub 上多半是整包拷走的。公开复制图覆盖两百多万次采纳:按星数审仓几乎拦不住后续高风险技能,按复制出度审前一百仓能拦住 14.9%,副本很少跟着源头改。

智能体评测一掉分,第一反应常是模型不行。这篇把尺子压一遍:换包装几乎不翻盘,两家裁判却对不上百分之五十七。误导命名还能再掉零点二到零点四。配套仓本轮仍是零星。

工具输出堆在一起时,事实在证据里不等于出处也对。这篇按声明去对来源,专家要拦一百三十九条,拦住一百三十八。复现代码还没放,仓里目前是稿件和海报。

改设置就能灭的工单,文本对上了也不等于真机过关。这篇先复现再执行,九份能复现的工单跑出三百二十二条修复。换执行器平均挪三十八点八个点。本轮没有项目仓。

问句还没来就砍缓存,预算很容易摊薄。这篇先让模型代读六问,再按块钉锚,留百分之五大约能放下二十份缓存。实验跑在开源压缩套件里。本轮没有独立仓。

推理越写越长,分数板却常把输出熵当成没把握的全部证据。这篇在三分之二深处读四个不确定方向,控长度后三档仍高于两条老基线。公开仓六星,页上没写许可证。

检索到的技能卡,不到四分一真能教。这篇先记蒸馏信号,再只留后期还在贡献的六张。八十亿档均分从六十四点三到六十六点三,全库最大十一倍。本轮没有公开仓。

终端题涨了分,换套件常常又红。这篇把轨迹按出处对齐再训,九十亿档晋升集从七十八到九十。换到公开集就贴基座。混进别家轨迹,模型分还是零。本轮没有公开仓。

长对话不该先砌一张总图再什么都往上抠。这篇先收事件和轨迹,问句到了再组局部图。LoCoMo 裁判分八十二点七七,拿掉原子事件宏观分掉得最多。本轮没有公开仓。

检索证据和模型旧印象打架时,答对了也不等于会认不确定。四套套件用识别、解决、上交三条轨迹看知识冲突。改提示能抬上交率,任务分常一起掉。本轮没有公开仓。

生成测试常被直接推进回归套件。这篇把突变当假故障,看测试到底在罚谁。假错误比真抓到的多三到六倍,八成以上还会跟着后面的合并请求走。本轮没有公开仓。
