Prometheus + Grafana 全栈监控、Zabbix 传统监控、告警分级与多渠道通知
某互联网公司运维团队只有 3 人,管理 200+ 台服务器和 50+ 个微服务。之前靠"用户投诉才知道挂了",需要搭建一套覆盖基础设施、中间件、应用的全方位监控体系。
部署 Prometheus Server 集群(2 节点 HA)+ Thanos 实现长期存储和全局视图。Node Exporter 采集主机指标,Blackbox Exporter 做 HTTP/TCP 拨测,Spring Boot 应用接入 Micrometer。
某传统企业已使用 Zabbix 5.0 多年,监控 500+ 台服务器和网络设备。随着 K8s 和微服务引入,Zabbix 对容器环境的监控支持不足,需逐步迁移到 Prometheus 生态,同时保留对网络设备 SNMP 的支持。
采用双轨并行策略:网络设备(交换机、防火墙)和传统物理机保留 Zabbix,K8s 集群和微服务接入 Prometheus。通过 Grafana 统一展示两个数据源,告警统一由 Alertmanager 管理。
Prometheus 运行 6 个月后,磁盘占用从 50GB 膨胀到 800GB,查询速度严重下降(Dashboard 加载超过 30s),且 OOM 频繁。监控对象从最初 200 个 Target 增长到 2000+。
通过降低 Scrape 间隔、优化 relabel_configs 减少 label 基数、实施 Recording Rules 预聚合、引入 Thanos 实现长期存储分离。最终磁盘占用降低 65%,查询延迟 < 2s。