ByteNoteByteNote
Claude in Chrome 正式全面开放:带三层提示注入防御的浏览器代理

字节笔记本

2026年8月28日

Claude in Chrome 正式全面开放:带三层提示注入防御的浏览器代理

API中转
¥120

Claude in Chrome 结束试点,正式面向所有付费 Claude 计划全面开放。Claude 现在可以在浏览器里自主执行操作,不用你逐步审批每个动作;执行前有安全分类器逐个校验,确保操作安全且符合你的原始请求。这篇文章来自 Anthropic 官方博客,重点拆解了它对抗提示注入的三层防御和最新评估数据。

为什么需要它

日常工具大多已经通过连接器接入了 Claude,但公司内部仪表盘、遗留系统、供应商门户这些没有 API 的页面始终够不着。Claude in Chrome 让 Claude 借用你已有的登录状态直接操作这些页面:查看当前页面、读取和输入文本、点击链接、页面间导航、填写表单。去年它以试点形式亮相,试点期间团队持续加固针对提示注入攻击的防御,现在正式转正。

提示注入的三层防御

提示注入指攻击者把恶意指令藏在网页、邮件或表单字段里,诱导 AI 代理执行用户没要求过的操作。举个例子:你让 Claude 代拟邮件回复,某封邮件里藏的指令可能诱使它把你的其他邮件转发给攻击者。Claude in Chrome 用三层机制应对:

第一层,模型本身更难被骗。 Anthropic 用内部自动化攻击程序、外部红队和真实环境监控构建了一个不断扩充的攻击库来训练模型;新发现的成功攻击会进库,用于训练未来的模型和部署防护。

第二层,探针筛查网页内容。 网页内容经由工具结果到达 Claude 之前,训练出的探针会扫描其中潜藏的注入;检测到疑似攻击时,Claude 会被提示以怀疑态度对待这些内容,必要时先跟你确认。这套探针最初随 Claude Opus 4.5 部署,覆盖面持续扩大。

第三层,执行前操作校验。 Claude 会自动批准它判定为安全的操作——机制与 Claude Code 的 auto mode 相同,可在设置里关掉退回手动审批。分类器审查即将执行的动作(跳转新网站、输入文本等),与你的原始请求比对,不匹配就拦截。

评估数据:攻防现状

试点发布时建立的旧评估里,在 Cowork harness 下即使不开探针和分类器,针对多代模型的攻击全部零成功;因为结果已经饱和(0% 成功率),该评估退役。现在的评估换用了职业红队提供的更强攻击:

  • 不加额外防护时,到达模型的攻击对 Opus 4.5 的成功率为 17.6%,对 Opus 5 为 3.8%
  • 采用 2025 年 11 月的最强防护后,Opus 4.5 配合探针为 16.7%
  • Opus 4.8 及之后的模型配合探针和安全分类器:Sonnet 5、Opus 5、Mythos 5 零攻破,Fable 5 的成功率为 0.3%
  • 所有成功攻破的案例经人工核实均属低危场景,正在持续修复

两点诚实的脚注:并非所有攻击都能到达模型,某些路径下 Claude 根本不会接触恶意指令;不同模型的思考模式配置有差异,评分流水线升级后加了人工复核以减少误报。Anthropic 也承认提示注入是持续演变的移动靶,会随每次模型发布继续投入攻击发现、红队和更强的分类器。

怎么用

通过 Chrome Web Store 安装。企业版管理员可以在 Organization Settings 里管理该功能,还能限制只允许已批准的域名。

限制也要知道:处理本地文件或其他应用仍需 Claude 桌面端;目前只支持 Chrome,其他 Chromium 系浏览器不支持,移动端也还没有。


本文翻译转载自 Anthropic 官方博客 Claude in Chrome is generally available,发布于 2026 年 8 月 26 日。

分享: