构建生产级监控体系的能力缺口
许多技术学习者卡在“只会装软件,不会查故障”的阶段。当线上环境出现 CPU 飙升或响应延迟时,往往只能靠肉眼盯日志,缺乏系统化的观测手段。这门课解决的核心问题,是帮你补齐从数据采集到告警响应的完整闭环能力。它不只讲 Prometheus 怎么安装,更聚焦于如何对接 MySQL、Redis、Nginx 等常见组件的 Exporter,以及利用 Consul 或 DNS 实现动态服务发现。对于准备转岗 SRE 或负责后端稳定性保障的读者,这是绕不开的基础设施课程。若你目前只能监控裸机,或者无法理解监控图表中指标波动的含义,这门课正好填补这块短板。它强调“黑盒监控”与“时序数据库”的结合,让你明白为什么单纯的存活探测不够,需要深入业务层级的指标分析。
入门门槛与高效学习路径
学习前建议具备 Linux 基础,能熟练使用 Shell 编写简单脚本,并对网络请求原理有基本认知。不需要精通 Kubernetes,但需理解容器化部署的基本概念,因为课程涉及 Docker 安装流程。学习顺序上,不要急着跳到最后写复杂的 PromQL。建议先花两到三天时间,彻底掌握 Node_exporter 部署主机监控,并手动配置好 MySQL 和 Redis 的指标暴露。这是数据源的基础,源头错了,后面全是白费。接着重点攻克服务发现机制,理解静态文件、Consul 和 DNS 三种方式在动态环境中的适用场景。最后再集中时间研读 PromQL 章节,特别是聚合操作符与时间选择器,这部分是写告警规则的关键。学习过程中,每理解一个概念,务必在本地测试环境复现一次,避免陷入“看懂了但不会配”的假知状态。
学完能独立做什么及资料配合
完成全部课程练习后,你应当能独立搭建一套覆盖主机、数据库、缓存和 Web 层的企业级监控集群。你不仅能写出针对 QPS、错误率和延迟分布的精准告警规则,还能通过黑盒监控定期探活前端入口,在故障发生前收到预警。更重要的是,你能编写复杂的 PromQL 查询语句,从海量时序数据中快速定位性能瓶颈,而不再依赖直觉猜测。课程提供的资料包包含现成的配置文件模板和实操指南,但不要照搬。建议将其作为对照检查清单:每部署一个 Exporter,就核对资料中的参数是否合理;每学完一节 PromQL,就结合资料中的案例,用自己环境的真实数据重写三个查询。通过这种“理论-实操-校验”的循环,将监控知识转化为肌肉记忆,确保在面对突发故障时,能迅速调出正确的排查思路。
课程介绍
01.课程大纲介绍 02.prometheus架构介绍 03.基于二进制文件安装prometheus 04.docker安装prometheus 05.Linux主机监控(node_exporter) 06.数据库监控(mysqld_exporter) 07.redis监控(redis_exporter) 08.Nginx监控(nginx-vvep-exporter) 09.黑盒监控(blackbox_exporter) 10.基于文件的服务发现 11.基于Consul的服务发现 12.基于DNS的服务发现 13.prometheus的Relabelling标签的使用 14.时序数据库介绍 15.PromQL数据类型介绍以及时间序列选择器的应用 16.PromQL聚合操作介绍 17.PromQL运算符介绍 18.PromQL函数介绍 19.Altermanager简介及机制 20.使用二进
课程目录
01.课程大纲介绍 02.prometheus架构介绍 03.基于二进制文件安装prometheus 04.docker安装prometheus 05.Linux主机监控(node_exporter) 06.数据库监控(mysqld_exporter) 07.redis监控(redis_exporter) 08.Nginx监控(nginx-vvep-exporter) 09.黑盒监控(blackbox_exporter) 10.基于文件的服务发现 11.基于Consul的服务发现 12.基于DNS的服务发现 13.prometheus的Relabelling标签的使用 14.时序数据库介绍 15.PromQL数据类型介绍以及时间序列选择器的应用 16.PromQL聚合操作介绍 17.PromQL运算符介绍 18.PromQL函数介绍 19.Altermanager简介及机制 20.使用二进制文件方式安装Altermanager 21.使用docker安装Altermanager 22.Altermanager主配置文件详解 23.prometheus告警规则 24.Email接收告警 25.企业微信接收告警 26.基于Webhook的钉钉接收告警 27.Altermanager告警临时静默 28.Grafana概述 29.Grafana使用yum方式安装 30.使用docker安装grafana 31.Grafana基本概念 32.Grafana添加prometheus数据源 33.Grafana导入仪表盘 34.定制监控图表 35.饼图的遗留问题的解决 36.Pushgateway简介 37.安装pushgateway并与prometheus关联 38.Pushgateway数据管理 39.Openstack云计算监控方法 40.Docker容器监控 41.mtail日志监控 43.构建联邦集群系统 44.监控报警高可用架构实战 资料




