如果你现在的监控还停留在「Zabbix 装上了、模板套上了、报警响了再看」,那这门 Prometheus 专题大概率会戳到你的痛点:指标从哪来、存成什么样、告警怎么才不炸群,这三件事只要有一件没想清楚,监控系统就只是个昂贵的闹钟。

先确认你是不是这门课的目标读者

这门课不是给完全没碰过 Linux 和服务端的人准备的。它更适合三类人:一是正在用 Zabbix 或自研脚本做监控,被浮点指标、标签维度、高基数问题卡住的运维;二是要接手 Kubernetes 集群、发现容器一重启监控就断档的人;三是转岗做 SRE/可观测性方向,需要把 Prometheus 生态的术语和组件关系理顺的测试或后端同学。

反过来说,如果你的日常只是看现成大盘、不碰采集配置和告警规则,那先补一下时间序列的基本概念再来,会更顺。

课程覆盖的能力缺口

从专题讲座的组织方式看,它主要补的是四个缺口:

  • 概念对齐:把 Prometheus 的拉取模型、Exporter、Pushgateway 各自适用的场景讲清楚,解决「什么时候该用推、什么时候该用拉」这种一知半解的问题。
  • 指标与查询:围绕指标类型和 PromQL 展开,重点是让你能自己写出「按实例、按接口、按状态码聚合」的查询,而不是复制别人的表达式改改标签。
  • 告警链路:从规则定义到分组、抑制、静默,处理告警风暴和误报,这是实际值班时最容易被投诉的部分。
  • 运维落地:采集目标的配置方式、服务发现、数据保留与存储的基本取舍,也就是「装完之后怎么长期维护」。

这些点单看都不难,难的是它们互相咬合——标签设计错了,PromQL 怎么写都别扭,告警也就跟着乱。

建议的学法:边看边动手

Prometheus 是典型的「看会了、写就废」的技术。建议每看完一段就做三件事:

  • 在本地或测试机起一个最小实例,挂一两个 Exporter,先看到数据真的进来了再往下走。
  • 把课里出现的查询表达式自己敲一遍,故意改错标签,观察返回结果怎么变,理解标签匹配的语义。
  • 写一条告警规则,让它真的触发一次,再走一遍静默和恢复,确认通知符合预期。

这样过一遍,比连刷视频然后回头再补要省时间。有 Zabbix 经验的读者还可以把同一台机器的指标在两套系统里各采一份,对比一下数据模型的差异,理解会更深。

看完你应该能回答这些问题

  • 一个自定义业务指标,从应用暴露到能被查询,中间要经过哪些环节?
  • 为什么同一个指标加了某个标签后,查询变慢甚至内存飙升?该怎么改标签设计?
  • 告警规则里的「持续多久才发」和「多久算恢复」,分别由什么决定?
  • 采集目标频繁上下线时,配置和服务发现分别怎么处理?
  • 面对一台刚接管的机器,你会先采哪些指标,理由是什么?

如果这些问题你现在答不完整,那这门专题的方向就是对的;看完之后能一条条讲清楚,说明监控这块的能力缺口已经补上了。剩下的,就是在自己的环境里真的跑起来。

51CTO-大米运维课堂-最前沿开源监控prometheus专题讲座

深入浅出Prometheus监控实践

编辑点评

系统化学习Prometheus,从基础到高级,涵盖监控架构、数据采集、告警管理,适合运维工程师提升技能。

⭐ 编辑推荐

本课程由51CTO大米运维课堂倾力打造,带你全面掌握Prometheus监控技术。

课程亮点

• 系统化学习Prometheus
• 从基础到高级
• 涵盖监控架构、数据采集、告警管理

课程目录

├─01-prometheus初级
│ 01.prometheus的介绍-1.mp4
│ 02.prometheus的介绍-2.mp4
│ 03.prometheus的基础理念.mp4
│ 04.prometheus的监控分类.mov
│ 05.prometheus的架构.mov
│ 06.prometheus的监控项讲解.mov
│ 07.prometheus的企业讲解.mov
│ 08.prometheus的特点缺点.mov
│ 09.prometheus的命令行.mov
│ 10.prometheus的组件.mov
│ 11.prometheus的metrics.mov
│ 12.prometheus的监控图及命令行.mov
│ 13.prometheus的数据key-value.mov
│ 14.prometheus的key及组件.mov
│ 15prometheus的启动及设置.mov
│ 16.prometheus的监控cpu实例.mov
│ prometheus-教学文档01.pdf
├─02-prometheus中级
│ 01.prometheus计算cpu的使用率算法-1.mp4
│ 02.prometheus计算cpu的使用率算法-2.mov
│ 03.prometheus的计算函数.mov
│ 04.prometheus公式拆分详细讲解.mov
│ 05.prometheus的公式得到最终解控指标结果.mov
│ 06.prometheus的公式取单个指标的值.mov
│ 07.prometheus的gauge类型数据bash脚本pushgateway到server.mov
│ 08.prometheus的采集回来的数据用lable修饰后数值过滤.mov
│ 09.prometheus的counter类型取数据每秒平均数.mov
│ 10.prometheus的rate函数曲线图详细介绍.mov
│ 11.prometheus的sum函数及集群划分数据展现.mov
│ 12.prometheus的topk函数及count函数的使用.mov
│ 13.prometheus的安装部署后台运行.mov
│ 14.prometheus的部署与配置文件详讲解.mov
│ 15.prometheus的配置文件.mov
│ 16.prometheus的node_exporter的安装启动项.mov
│ 17.prometheus的监控项命令行讲解.mov
│ 18.prometheus的pushgateway及自定义脚本.mov
│ 19.prometheus的pushgateway的优缺点.mov
│ 20.prometheus的exporter代码讲解.mov
│ 21.prometheus的Grafana介绍图形.mov
│ 22.prometheus的Grafana图形设置项细讲.mov
│ 23.prometheus的Grafana的Alerting报警-1.mov
│ 24.prometheus的Grafana的Alert报警-2.mov
│ 25.prometheus的Grafana的Alert报警-3.mov
│ 26.prometheus的企业实践CPU监控.mov
│ 27.prometheus的企业实践Memory的监控.mov
│ 28.prometheus的企业实践使用率推算函数.mov
│ 29.prometheus的企业实践io-网络传输监控.mov
│ 30.prometheus的企业实践网络连接wait和file_ulimit的监控.mov
│ 31.prometheus的企业实践网络延迟丢包监控.mov
│ 32.prometheus的企业级Pagerduty使用.mov
│ 33.prometheus的总结.mov
│ promethues下篇PDF.pdf
└─03-prometheus高级
01.监控介绍.mp4
02.prometheus的组件介绍.mov
03.prometheus数据及安全模型介绍.mov
04.prometheus在centos7上安装.mov
05.prometheus在docker容器中运行.mov
06.使用Node-exporter监控节点.mov
07.使用容器cAdvisor监控节点.mov
08.label标签的配置使用.mov
09.监控cpu利用率.mov
10.监控内存使用率.mov
11.监控磁盘空间及预算磁盘饱满时间.mov
12.监控服务状态.mov
13.通过文本获取metric.mov
14.通过记录规则持久查询.mov
15.通过grafana监控metric.mov
16.基于文件目标发现.mov
17.基于DNS服务的目标发现.mov
18.AlertManager介绍.mov
19.AlertMangeager安装配置及设置邮件报警.mov
20.添加磁盘和节点告警.mov
21.添加prometheus和systemd服务.mov
22.AlertManager路由配置.mov
23.AlertManager静默配置.mov
24.prometheus和alertmanager高可用.mov
25.alaertmanager集群配置.mov
26.prometheus集群配置.mov
27.远端探测介绍.mov
28.black_exporter配置使用.mov
29.PushGateway推送网关介绍.mov
30.PushGateway配置.mov
31.prometheus在k8s安装环境介绍.mov
32.Node_exporter在k8s上的部署.mov
33.prometheus在k8s上部署.mov
34.Grafana在k8s行的部署.mov
35.解决Grafana中CPU不显示数据问题.mov
36.AlertManager在k8s上的部署.mov
prometheus1-5.pdf

适合人群

  • 运维工程师
  • 系统管理员
  • DevOps工程师

学习收获

掌握Prometheus监控架构
精通数据采集与处理
学会告警管理与优化

祝您学习愉快!

学有所成,前程似锦!