ByteNoteByteNote
让 agent 帮你挑酒店?它可能先看牌子
字

字节笔记本

2026年10月5日 · 约 2 分钟读完

让 agent 帮你挑酒店?它可能先看牌子

API中转
¥120

把选酒店、挑商品、定参考文献交给 agent 代办之前,值得先读一篇新论文:Jonghyun Song 等人的 Source Preference in the Wild(arXiv:2610.03195,41 页)。它问的问题很朴素:当候选项都满足需求时,agent 会怎么选?

论文封面图

实验发现:来源偏见是系统性的

作者在端到端搜索场景里测了 12 个 agent 模型,覆盖商品、酒店、待引论文三个领域。结论一致:在选项同等满足需求的情形下,每个模型都会系统性地偏好某些来源、回避另一些,而且模型之间对谁好谁坏的判断高度一致。

偏见的强度超出直觉。一个来自偏好来源的选项,哪怕比对手少满足一条明确需求,仍有约三分之二的概率被选中;反过来,非偏好来源的选项即使多满足一条需求也几乎不会赢。也就是说,来源标签的权重压过了用户明说的条件。

两个操纵实验证实了因果:把来源信息隐藏,偏见显著减弱;把同一个选项贴上偏好来源的标签,选中率立刻上升。驱动选择的就是来源身份本身。

成因与解药

偏见成因与缓解图解

论文检验了两个成因。其一是捷径学习:训练时奖励的是物品质量,模型学会了把来源当作质量的代理特征。其二是信息缺口:当关键信息缺失时,模型用对来源的成见补位。

对应的解药也直接:补齐缺失的关键信息,偏见随之下降;在提示词里明确反驳来源成见,同样有效。对做导购、推荐、文献筛选类 agent 的团队,这篇论文给的操作建议是把来源字段当一等公民来审计,必要时主动脱敏或加权对冲。页面未见代码链接。

一句话总结

agent 的公平性不只关乎敏感属性,连品牌与出处都会成为隐形的手。用户以为自己在按条件筛选,实际上模型的成见可能已经先投了一票。

相关文章

分享: