有有台账、有监控、有日志,也接了链路追踪。可一出故障,大家还是要靠人肉在群里拼线索。
工具往往已经够多,真正缺的是把发现、定位和处置接起来。下面用 6 张图说清楚。
01|先看整条闭环
发现异常只是开始。定位、恢复、复盘和预防接得上,处理过的问题才不会一再重来。
02|三类数据怎么配合
Metrics 看趋势,Traces 找链路,Logs 查现场。排障时把三者串起来,比来回切平台省事得多。
03|数据从哪里来
应用和基础设施产生数据,经过采集、清洗和统一标签,再写入对应的存储系统。
04|告警要落到具体的人
一条告警要有级别、上下文和责任人。进入事件流程后,处置过程和恢复结果也要留痕。
05|AI 适合放在哪里
先让 AI 整理告警、分析根因、推荐方案。高风险操作保留人审,并准备好回滚路径。
06|建设有没有效果
别只数接入了多少工具。发现快不快、恢复要多久、同类问题是否复发,这些更值得看。