最近, 有一款开源项目, 它迎来了第一个稳定版本, 这个稳定版本是v1.1。
这并非是另外一套监控系统, 而是一个平台, 这个平台专门用于管理值班排班, 用于管理告警路由, 用于管理升级策略, 用于管理应急响应。
它所针对的目标用户是十分明确的, 是SRE, 是平台工程师, 是基础设施和运维团队, 尤其是那些并不愿意将事故响应流程完全托付给等同云服务的同学们。
不搞监控,只做“中间人”
一种角色, 它特别不复杂, 它会接收从监控工具那儿发送过来的告警信息, 收下后再转送给应当去处理这些的那帮人, 它完全就是这样。
收到告警之后, 对其来源进行校验, 对标签进行校验, 对严重程度进行校验, 对路由规则进行校验, 及对归属团队进行校验, 之后精准推送给当下值班人员。
你点击一下“确认”, 再点击一下“解决”, 接着点击一下“静默”, 又可能碰见这样的情况, 等人超过规定时间却没有任何反应, 之后它开始自动升级, 然后转给下一个人——绝对不会让告警就那样无果地搁置在手里。
排班、轮转、升级,全都有
这套平台支持:
首先, 倘若存在有人遗漏查看告警的情况, 它会先是一再反复地进行提醒, 之后, 它会自行自动地朝着上方进行升级, 进而帮助你将那种“漏接警报”的风险降低到最低程度。
维护窗口 & 多团队隔离
实行计划内维护时, 直接设置维护窗口, 抑或是进行告警静默处理, 从而避免出现一堆毫无用处的通知, 致使屏幕被刷屏。
若你负责多个业务线, 或者掌管多个开发团队, 它会提供分组功能以及访问控制, 每个团队使用独立的“接入令牌”, 由谁发送来的告警, 就归谁去处理, 划分得非常清晰, 十分明确。
日历视图也内置了,当前谁值班、谁临时替换,扫一眼就明白。
主流监控全适配
告警来源方面,它已经集成了:
通知渠道极为多样, 有Slack, 有Teams, 有邮件, 有浏览器和PWA推送, 甚至还有可插拔的语音电话服务, 能确保不让你有忘掉提醒的可能。
API +,运维友好
它开放了完整的 文档,支持个人 API 令牌。
更为贴心之处在于, 官方给出了独立的 , 那些钟情于 IaC(基础设施即代码)的同学能够直接凭借代码去管理告警路由以及排班配置。
️ 部署灵活,MIT协议随便用
因为是自托管,数据库和网络策略全由你掌控:
部署方式任选:
代码是通过特定方式写成的, 其开源协议选用的是超宽松的 MIT 协议, 你可以放心进行修改、能够随便加以使用。