
字节笔记本
2026年10月6日 · 约 2 分钟读完
harness 与推理引擎,开始对话
agent 跑得越来越快,两个软件层的失配却越来越贵:harness 明明知道下一步要复用哪段上下文,推理引擎却只看到一堆孤立请求。周二批次的两篇论文分别处理这个接口问题与它的组织级放大版。

HEAR:让两层互相听得见
Jiaqi Zhao 等三位同等贡献作者的 HEAR(arXiv:2610.06597)是一个双向的 harness 与引擎配对协议。下行方向,harness 把工作流依赖、上下文生命周期与执行目标标准化地告诉引擎;上行方向,引擎把请求队列、KV 缓存状态、资源压力与执行能力回传给 harness。设计上的关键是协议语义与优化策略解耦:协调策略可以千变万化,工作流与模型语义一字不改。
数字相当能打。四个对话与研究 agent 基准的内存受限并发服务里,批处理加速 1.61 倍,SCBench 的首字延迟中位数降 2.23 倍,Mooncake 实验显示互补收益;BrowseComp-Plus 与 DeepResearchBench 上按负载选执行模式,端到端分别 1.23 与 2.45 倍提速,质量无观测退化。自建 agent 服务栈的团队,这份协议值得当接口设计参考。页面未见代码链接。
MiniCorp:把公司装进模拟器

Jingying Zeng 等人的 MiniCorp(arXiv:2610.05912)问的是另一个问题:一群 agent 集体经营一家公司时会涌现什么。以电商公司为样例,模拟器连接内外两个世界:外部有客户、竞争对手与市场机制,内部是观察、讨论与决策的 agent 群,决策产生持久的市场后果,反馈又塑造后续选择。
最有工程价值的是检查点机制:同一局面可以换不同决策重放,做真正的反事实对比,这是静态企业档案永远给不了的。端到端保真度对照真实市场研究的模式校准,降低 agent 钻模拟器空子的风险。实验里 agent 能跨角色协调、随反馈调整,在显式长期战略引导下甚至能扛住早期弱回报坚持广告探索。论文把它定位成 AI 公司的实验环境加纵向反事实企业数据源。同样未见代码链接。
放在一起读
一篇给 agent 个体修路(协议层提速),一篇给 agent 组织建城(模拟器实验)。与站内 RLM 访谈里 harness 与引擎结构同构的判断放在一起看,接口标准化这步棋正在从论文走向必需品。



