
字节笔记本
2026年8月28日
Claude 值班:Claude Tag 是 Anthropic CI/CD 故障的第一响应者
晚上十点,值班工程师收到消息:新服务约 44 个测试没跑。过去要花约一小时排查,现在他直接 @Claude——Claude 发现测试消失与当天早上开的一个 feature flag 有关,判断回滚安全;同事回滚后,Claude 三分钟内在 Slack 确认 skip rules 已移除、错误率回到基线。这是 Anthropic CI 团队工程师 Sachin Malhotra 讲的第一人称故事:Claude Tag 已经是 Anthropic CI/CD 故障的第一响应者,近期所有有 situation report 的事故,首份报告都由 Claude 撰写。
怎么搭起来
骨干是 Claude Tag:在 on-call Slack 频道保持记忆、提供指令接口、实时响应频道事件,例程用自然语言调度(「每周一 9:00 跑 CI 交接」)。它有独立的 service account,能访问 Datadog、Grafana 等工具,由管理员一次性配置,同时监听相关频道获取警报、配置变更、PR 更新等上下文。
常设指令以 markdown skills 的形式存在 GitHub 仓库里,团队像管理代码一样迭代,里面有路由规则、策略,和一份会自我改进的 lessons.md。整体搭建耗时数小时而非数天;Anthropic 开源了 on-call setup kit(github.com/anthropics/oncall-kit),能把团队自己的事故历史转化成 triage playbook。起步需要 Claude Team/Enterprise 计划。
检测:告警是确定性的,升级带 agentic
两个人工时代的老问题被解决:一是人工难以设出完美的告警阈值(新服务数据不足时尤其如此)——Claude 会分析新服务头几天的数据并建议、微调规则;二是告警疲劳——Claude 按 oncall.md 里的标准逐条判定是立即 page 还是留到早上,比如「错误率超 2% 且持续超 5 分钟、又不是已知部署窗口才 page,否则记入 lessons.md」。
分诊:并行调查,14 分钟出首份分析
Claude 首份有证据支撑的分析中位耗时是事故开启后 14 分钟,最快 4 分钟就在首份报告里点名根因。机制是 dynamic workflow:orchestration agent 派生多个 executor subagents 并行调查各依赖和数据源(Grafana、日志存储、PagerDuty、GitHub、Kubernetes、Slack,都经 MCP 接入),结果汇总成 SITREP。
调查由 skills 指导,比如一份 617 行的 shadow divergence 调查 skill——就是作者和 Claude 一起排障之后,让 Claude 自己生成的。lessons.md 记录每次事故的起因、根因、修复和坑,Claude 自动追加,每次调查先读它,重复出现的模式会被提升进 skill。作者最喜欢的一条是 Claude 写他的教训:先查数据再理论——配置告诉你什么可能出错,指标告诉你什么真的出错了。Claude 不总是一次就对,人的直觉仍然重要,所以 Claude Tag 支持多人实时共同引导调查。
解决与收尾
多数部署在 feature flag 后面,作者另建了一个带他权限的 Claude Code agent 管渐进发布:管 canary 流量、监控、自动升降 flag。最常见的产出是修复 PR,交给 on-call 审查合并部署。修复后用同一套连接器验证,post-mortem 写入 lessons.md,交接 SITREP 自动生成。还有个叫 ci-weather 的 agent 向全公司公开频道发新闻式 CI 天气报告,别人不用再来问「CI 怎么了」。作者诚实地备注:报告格式迭代了很多次——Claude 能一次生成 skill,但可读性取决于团队的品味,毕竟那是人与人的沟通,不是管道工程。
效果
Anthropic 工程师平均每季度的代码产出是 2021-2025 年的 8 倍,而质量门槛没变:PR 有具名的人类 owner、变更需批准、统一 CI 门。作者的一句话概括了整套东西存在的理由:跟上 agentic coding 的唯一办法是 agentic CI。
本文编译转载自 Anthropic 官方博客 Claude on call: How Claude Tag serves as Anthropic's first responder for CI/CD failures,作者 Sachin Malhotra,发布于 2026 年 8 月 18 日。