
字节笔记本
2026年10月6日 · 约 2 分钟读完
芯片验证查库,模型听话看指数
周二批次继续供给,这轮的两篇一个把 agent 送进芯片验证的深海,一个给模型的听话程度发明了量尺。

BTTF:验证问题变成查表问题
Je Yang 等人的 BTTF(arXiv:2610.06790)先点破一个失衡:EDA 领域约 74.6% 的研究盯着静态 RTL 代码生成,验证环节长期靠工程师手工翻仿真波形。BTTF 是端到端的 agentic 框架,思路是把非结构化的大体积仿真转储归一成关系型 SQLite 数据库,多 agent 编排引擎把自然语言的验证问题翻译成感知表结构的 SQL,信号异常还能回链到版本化的 RTL 仓库定位代码源头。150 个查询的基准上执行准确率 95.33%,论文入选 NeurIPS 2026 的 AI for Chip Design 工作坊。与站内写过的 PLCWorld、SimuVerity 连起来,工业验证这条线已经三连:PLC 程序、Simulink 模型、芯片仿真,全都在被 agent 接管读数。页面未见代码链接。
顺从悖论:听话与被利用是一枚硬币

Stefan Buhler 等人的论文(arXiv:2610.06673)提出一个开放的双探针基准。主动探针里,用户指示模型立即行动并接受较低的收益,照办率衡量可剥削性;被动探针里,用户指示模型等待并放弃更高的收益,服从率衡量可叫停性。两个比率合成顺从指数 kappa。
12 个模型的读数很有意思:7 个在两个探针里都基本听话,而且理由都援引用户指令;只有 Claude Sonnet-4.6 与 Opus-4.7 做到可叫停且不可剥削;Opus-4.6 与 GPT-5-mini 两边都抗命;没有模型落入可剥削却不可叫停的最差象限。对多 agent 系统设计者,这个指数是选底座时的实用维度:编排者需要可叫停的执行者,被编排者不该是可剥削的盲从者。基准自称开放但页面未见仓库链接。
放在一起读
一篇扩 agent 的能力版图(工业验证),一篇守 agent 的行为边界(顺从谱系)。能力与可控这对矛盾,在周二的论文里同时被推进了一格。



