写点什么

运维自动化之监控平台

作者:大V
  • 2022-12-27
    北京
  • 本文字数:785 字

    阅读完需:约 3 分钟

运维自动化之监控平台

告警中心 Saturn 平台


简介

Saturn 平台可以解决多种监控平台产生的报警统一管控,类似监控中间件的功能,监控平台产生的告警发送给 saturn, 通过 saturn 统一查询分析报警、控制报警风暴、自定义报警发送渠道(钉钉、电话告警),saturn 还支持对收集到 ES、云厂商日志服务中的业务日志检索并报警, saturn 内置了中通天鸿呼叫中心免费 1000 条语音告警功能。



监控大屏


监控策略

监控策略对产生的告警执行策略参数配置的动作,例如自建业务日志收集到 ES 中,我们通过配置检索策略及满足执行告警条件后,即会执行策略对应的告警动作。



创建策略

策略分为基础监控和日志监控两种类型:

  • 告警维度:支持主机、产品线、标题、等级等维度对产生的告警匹配策略,匹配到的告警按照对应策略参数执行告警动作。

  • 重复周期与告警次数属于一对配置参数,即策略在周期时间内执行满足配置的告警次数后触发告警动作。

  • 自动恢复: 正常基础告警会发送告警和恢复告警,自动恢复代表不会收到恢复告警,收到告警后会发送一次告警后状态自动变为恢复状态。适用于日志关键告警和自定义类告警即实时告警。

  • 维护时间:是在该时间范围内产生的告警只做记录,不发告警

  • 支持多种渠道告警,钉钉、飞书、电话告警,电话告警采用中通天鸿通信有限公司呼叫中心语音消息,默认每个用户都有 1000 条的语音消息告警,电话告警可以有效保证告警处理及时性、保证生产业务的稳定性。


以日志监控为例创建策略,每条策略会管理对应的产品线,会自动检索 es 中对应命名空间和容器名称下的日志内容。同时产生告警后会自动关联产品线的负责人,并按照配置的通知渠道发送告警。具体产品线相关功能请移步到产品线管理Github了解。




监控静默

对于发生暂时未恢复的告警配置静默一段时间,不发送告警提醒创建静默的方式:

  • 告警历史中的告警记录直接创建静默

  • 可通过发送给钉钉机器人消息中的静默链接静默

  • 可通过云效平台告警管理中的静默管理创建静默




告警记录


点我进入监控对接方法

用户头像

大V

关注

还未添加个人签名 2018-08-13 加入

从事运维开发工作,擅长Devops运维自动化平台开发。熟悉开发语言golang、vue等。 开源项目:https://github.com/zttheff/gops, 一站式运维自动化平台天鸿云效,产品线管理、 Kubernetes 原生 CI/CD、告警管理等。

评论

发布
暂无评论
运维自动化之监控平台_DevOps_大V_InfoQ写作社区