开源追旗舰的账,这次算在推理开销上
开权重模型追旗舰,Beam 换了个算法:501B 总参 23B 激活的稀疏专家,编码推理三线进第一梯队,同档任务对一款旗舰省 3 到 4 倍推理算力。权重本月按 Apache 2.0 放出,先走小范围 Early Access。

发现 AI Agent、开发工具、开源项目与效率软件,跟上每日科技与工程实践。
编辑精选
生产事故排障要同时读日志、指标、链路、手册和部署记录,人脑切换成本极高。Tracer-Cloud 开源 OpenSRE:11.6k 星、Apache 2.0,60 多个集成,证据驱动定位根因,标识符先脱敏再出网,还想当 SRE 界的 SWE-bench。

开权重模型追旗舰,Beam 换了个算法:501B 总参 23B 激活的稀疏专家,编码推理三线进第一梯队,同档任务对一款旗舰省 3 到 4 倍推理算力。权重本月按 Apache 2.0 放出,先走小范围 Early Access。

中型科技公司开始给非工程师搭内部平台,用对话生成内部网页和工具。报道点名 Ramp 和 Stripe 两家各建平台且都跑起来了,作者预计接下来会有更多公司跟进。

小米把 RL 后训练的账单、任务配比、防作弊机制全公开,环境和框架也一并开源,旗舰权重却没放。昨日榜单 68 赞还在升。配方公开与权重保留其实并不矛盾。

只把预算写进提示词,智能体的守时率只有 15%,平均超支六成。接上信息时钟再层层加码能爬到 88%,分数却纹丝不动。三步接法:给读数、给硬边界、再谈训练。

6840 道合成题上,模型越大越吃力,智能体靠工具几乎全对。可最预测真实基准失败的,是理解类调用次数,不是改动行数。代码理解才是编码智能体的瓶颈。

长会话还没到顶,硬截断就把前缀和旧观察砍掉。billion-context 让模型自己折成摘要,需要时再解压。研究口径 4.5 个月、17.4 万次调用,窗口违例是 0。先把代理接上再谈窗口。

本地模型在对话框里答完出行数据工程题,分数仍可能是虚的。1500 次试验里,工作区把通过率抬高 26.7 到 52.0 个百分点。最强档闭环过 85.3%,量化 9B 过 69.3%。先看现场自检档。

编码智能体把官方单测跑绿,评测单就会写成解决了。TestJack 在 8862 次运行里推翻 1545 次所谓正确,总解决率从 50.6% 掉到 33.2%。先问官方测试挡住了什么,再谈那条高分还在不在。

31 国 239 名评审里,持续集成已绿时无行为重构还愿往下看的人从 52.3% 掉到 19.7%。缺理由、验证和认领的时候,绿灯只证明构建过了,并不能证明这单真的有人在扛。

同一套可执行仓被拆成空仓、骨架、文件、函数四档。仓库级全过最高只有 31.0%,文件级能到 76.7%。函数绿了不等于整仓交得出去,评测单常把这个缺口悄悄抹平。

固件智能体改完还要过现场传感、时序和安全联锁。闭环评测 420 次试验里,主设置 gpt-5.4 过 14 次,本地 27B 过 9 次,一次提交变绿说明不了它会自己找证据。先看自检档。

工具智能体自己决定这一轮看见哪些官方观察。SSCBench 在 1191 次故障运行里仍报得出采纳率,可 44 次最终看得见反证的采纳里只有 17 次赶在首次使用前到场。先问时机,再谈失败。

编码智能体只看当前工作树,会漏掉已经合并的约束。Chronos 不微调,只在测试时把历史拉取请求做成经验卡;六套骨干在 SWE-Bench Verified 上均分从 69.2% 提到 72.9%,人工复核有用卡也接近翻倍。

技能包在 GitHub 上多半是整包拷走的。公开复制图覆盖两百多万次采纳:按星数审仓几乎拦不住后续高风险技能,按复制出度审前一百仓能拦住 14.9%,副本很少跟着源头改。

智能体评测一掉分,第一反应常是模型不行。这篇把尺子压一遍:换包装几乎不翻盘,两家裁判却对不上百分之五十七。误导命名还能再掉零点二到零点四。配套仓本轮仍是零星。

工具输出堆在一起时,事实在证据里不等于出处也对。这篇按声明去对来源,专家要拦一百三十九条,拦住一百三十八。复现代码还没放,仓里目前是稿件和海报。

改设置就能灭的工单,文本对上了也不等于真机过关。这篇先复现再执行,九份能复现的工单跑出三百二十二条修复。换执行器平均挪三十八点八个点。本轮没有项目仓。
