ByteNoteByteNote
半夜被报警叫醒的 SRE,先让 agent 看一眼
字

字节笔记本

2026年10月7日 · 约 4 分钟读完

半夜被报警叫醒的 SRE,先让 agent 看一眼

API中转
¥120

凌晨三点被报警短信叫醒,瞪着五块面板把日志、指标、链路追踪、运行手册和最近的部署记录在脑子里对齐,这是 SRE 二十年来的日常。Tracer-Cloud 开源的 OpenSRE 想把这个过程交给 agent 先过一遍:一个面向 AI SRE 的开源工具箱,GitHub 11.6k 星、1.7k fork、四千多次提交,Apache 2.0 协议,跑在你自己的基础设施上。

OpenSRE 仓库封面

项目简介

OpenSRE 的定位有两层。表层是排障 agent:它跨日志、指标、追踪、运行手册与部署记录做证据驱动的推理,诊断结论带互链的根因证据,不是拍脑袋的猜测;处置建议结合运行手册生成,贴合团队既有的 SOP。深层是训练环境:作者明确把它对齐 SWE-bench 的空缺,要做基础设施事故响应的 RL 训练基准,这个赛道目前没有公认方案,谁先做起来谁就有定义权。仓库结构清晰,core、gateway、integrations、surfaces、infrastructure 各司其职,Python 项目用 uv 管依赖,mypy 与 ruff 把关,Docker 部署,工程味很正。需要说明的边界:项目处于 Public Alpha,API 可能变;遥测默认开启,介意的话设 OPENSRE_NO_TELEMETRY 环境变量关闭。

核心功能

证据处理之外有两个值得单独点的安全与成本设计。其一,可逆标识符脱敏:主机名、IP、用户标识在送外部 LLM 前先掩码,回到本地再还原,敏感拓扑不出域,这解决了排障 agent 在合规环境落地的最大障碍。其二,会话成本记账:每次排查烧了多少 token 实时可见,长会话可断点续跑。集成面覆盖 60 多个:Grafana、Datadog、Kubernetes、AWS、Slack、PagerDuty、MCP 等都在列,Linear、Notion、Teams、Confluence 在路线图上。模型完全自选,Anthropic、OpenAI、Gemini、Bedrock 或本地 Ollama 都能接。还有个小而实用的彩蛋:它能监控本机的 agent 舰队(Claude Code、Cursor、Codex),管基础设施的同时顺便管住帮你写代码的那批 agent。

OpenSRE 排障闭环

快速上手

macOS 与 Linux 一条命令装好:

bash
curl -fsSL https://install.opensre.com | bash -s -- -gh

Windows 用 PowerShell 对应脚本。交互模式直接敲 opensre 进 REPL,边问边下钻;接值班管道用无头模式一句话开工:

bash
opensre ask "why is checkout-api slow?"

Python 侧走 bootstrap.embedded.start_embedded_session 起内嵌会话,把它编进自家运维平台当引擎用。

三种用法与工程细节

适合谁用

中小团队的 on-call 组是第一受益人:没有自建 AIOps 预算,但有多套监控栈要盯,OpenSRE 加自有模型钥匙就能起一个不知疲倦的一线排查员。有合规约束的企业看中脱敏设计,本地模型加可逆掩码的组合能过内部评审。两类人先别上车:追求 SLA 保障的团队注意这是社区项目无商业支持,Public Alpha 的 API 稳定性也要打折预期;重交易系统的一键修复场景仍应保持人在回路,agent 给证据与建议、人做最后决定,这个分工在当前阶段不该倒过来。

相关文章

分享: