如果你现在的监控还停留在「Zabbix 装上了、模板套上了、报警响了再看」,那这门 Prometheus 专题大概率会戳到你的痛点:指标从哪来、存成什么样、告警怎么才不炸群,这三件事只要有一件没想清楚,监控系统就只是个昂贵的闹钟。
先确认你是不是这门课的目标读者
这门课不是给完全没碰过 Linux 和服务端的人准备的。它更适合三类人:一是正在用 Zabbix 或自研脚本做监控,被浮点指标、标签维度、高基数问题卡住的运维;二是要接手 Kubernetes 集群、发现容器一重启监控就断档的人;三是转岗做 SRE/可观测性方向,需要把 Prometheus 生态的术语和组件关系理顺的测试或后端同学。
反过来说,如果你的日常只是看现成大盘、不碰采集配置和告警规则,那先补一下时间序列的基本概念再来,会更顺。
课程覆盖的能力缺口
从专题讲座的组织方式看,它主要补的是四个缺口:
- 概念对齐:把 Prometheus 的拉取模型、Exporter、Pushgateway 各自适用的场景讲清楚,解决「什么时候该用推、什么时候该用拉」这种一知半解的问题。
- 指标与查询:围绕指标类型和 PromQL 展开,重点是让你能自己写出「按实例、按接口、按状态码聚合」的查询,而不是复制别人的表达式改改标签。
- 告警链路:从规则定义到分组、抑制、静默,处理告警风暴和误报,这是实际值班时最容易被投诉的部分。
- 运维落地:采集目标的配置方式、服务发现、数据保留与存储的基本取舍,也就是「装完之后怎么长期维护」。
这些点单看都不难,难的是它们互相咬合——标签设计错了,PromQL 怎么写都别扭,告警也就跟着乱。
建议的学法:边看边动手
Prometheus 是典型的「看会了、写就废」的技术。建议每看完一段就做三件事:
- 在本地或测试机起一个最小实例,挂一两个 Exporter,先看到数据真的进来了再往下走。
- 把课里出现的查询表达式自己敲一遍,故意改错标签,观察返回结果怎么变,理解标签匹配的语义。
- 写一条告警规则,让它真的触发一次,再走一遍静默和恢复,确认通知符合预期。
这样过一遍,比连刷视频然后回头再补要省时间。有 Zabbix 经验的读者还可以把同一台机器的指标在两套系统里各采一份,对比一下数据模型的差异,理解会更深。
看完你应该能回答这些问题
- 一个自定义业务指标,从应用暴露到能被查询,中间要经过哪些环节?
- 为什么同一个指标加了某个标签后,查询变慢甚至内存飙升?该怎么改标签设计?
- 告警规则里的「持续多久才发」和「多久算恢复」,分别由什么决定?
- 采集目标频繁上下线时,配置和服务发现分别怎么处理?
- 面对一台刚接管的机器,你会先采哪些指标,理由是什么?
如果这些问题你现在答不完整,那这门专题的方向就是对的;看完之后能一条条讲清楚,说明监控这块的能力缺口已经补上了。剩下的,就是在自己的环境里真的跑起来。
51CTO-大米运维课堂-最前沿开源监控prometheus专题讲座
深入浅出Prometheus监控实践
编辑点评
系统化学习Prometheus,从基础到高级,涵盖监控架构、数据采集、告警管理,适合运维工程师提升技能。
⭐ 编辑推荐
本课程由51CTO大米运维课堂倾力打造,带你全面掌握Prometheus监控技术。
课程亮点
• 系统化学习Prometheus
• 从基础到高级
• 涵盖监控架构、数据采集、告警管理
课程目录
├─01-prometheus初级 │ 01.prometheus的介绍-1.mp4 │ 02.prometheus的介绍-2.mp4 │ 03.prometheus的基础理念.mp4 │ 04.prometheus的监控分类.mov │ 05.prometheus的架构.mov │ 06.prometheus的监控项讲解.mov │ 07.prometheus的企业讲解.mov │ 08.prometheus的特点缺点.mov │ 09.prometheus的命令行.mov │ 10.prometheus的组件.mov │ 11.prometheus的metrics.mov │ 12.prometheus的监控图及命令行.mov │ 13.prometheus的数据key-value.mov │ 14.prometheus的key及组件.mov │ 15prometheus的启动及设置.mov │ 16.prometheus的监控cpu实例.mov │ prometheus-教学文档01.pdf ├─02-prometheus中级 │ 01.prometheus计算cpu的使用率算法-1.mp4 │ 02.prometheus计算cpu的使用率算法-2.mov │ 03.prometheus的计算函数.mov │ 04.prometheus公式拆分详细讲解.mov │ 05.prometheus的公式得到最终解控指标结果.mov │ 06.prometheus的公式取单个指标的值.mov │ 07.prometheus的gauge类型数据bash脚本pushgateway到server.mov │ 08.prometheus的采集回来的数据用lable修饰后数值过滤.mov │ 09.prometheus的counter类型取数据每秒平均数.mov │ 10.prometheus的rate函数曲线图详细介绍.mov │ 11.prometheus的sum函数及集群划分数据展现.mov │ 12.prometheus的topk函数及count函数的使用.mov │ 13.prometheus的安装部署后台运行.mov │ 14.prometheus的部署与配置文件详讲解.mov │ 15.prometheus的配置文件.mov │ 16.prometheus的node_exporter的安装启动项.mov │ 17.prometheus的监控项命令行讲解.mov │ 18.prometheus的pushgateway及自定义脚本.mov │ 19.prometheus的pushgateway的优缺点.mov │ 20.prometheus的exporter代码讲解.mov │ 21.prometheus的Grafana介绍图形.mov │ 22.prometheus的Grafana图形设置项细讲.mov │ 23.prometheus的Grafana的Alerting报警-1.mov │ 24.prometheus的Grafana的Alert报警-2.mov │ 25.prometheus的Grafana的Alert报警-3.mov │ 26.prometheus的企业实践CPU监控.mov │ 27.prometheus的企业实践Memory的监控.mov │ 28.prometheus的企业实践使用率推算函数.mov │ 29.prometheus的企业实践io-网络传输监控.mov │ 30.prometheus的企业实践网络连接wait和file_ulimit的监控.mov │ 31.prometheus的企业实践网络延迟丢包监控.mov │ 32.prometheus的企业级Pagerduty使用.mov │ 33.prometheus的总结.mov │ promethues下篇PDF.pdf └─03-prometheus高级 01.监控介绍.mp4 02.prometheus的组件介绍.mov 03.prometheus数据及安全模型介绍.mov 04.prometheus在centos7上安装.mov 05.prometheus在docker容器中运行.mov 06.使用Node-exporter监控节点.mov 07.使用容器cAdvisor监控节点.mov 08.label标签的配置使用.mov 09.监控cpu利用率.mov 10.监控内存使用率.mov 11.监控磁盘空间及预算磁盘饱满时间.mov 12.监控服务状态.mov 13.通过文本获取metric.mov 14.通过记录规则持久查询.mov 15.通过grafana监控metric.mov 16.基于文件目标发现.mov 17.基于DNS服务的目标发现.mov 18.AlertManager介绍.mov 19.AlertMangeager安装配置及设置邮件报警.mov 20.添加磁盘和节点告警.mov 21.添加prometheus和systemd服务.mov 22.AlertManager路由配置.mov 23.AlertManager静默配置.mov 24.prometheus和alertmanager高可用.mov 25.alaertmanager集群配置.mov 26.prometheus集群配置.mov 27.远端探测介绍.mov 28.black_exporter配置使用.mov 29.PushGateway推送网关介绍.mov 30.PushGateway配置.mov 31.prometheus在k8s安装环境介绍.mov 32.Node_exporter在k8s上的部署.mov 33.prometheus在k8s上部署.mov 34.Grafana在k8s行的部署.mov 35.解决Grafana中CPU不显示数据问题.mov 36.AlertManager在k8s上的部署.mov prometheus1-5.pdf
适合人群
- 运维工程师
- 系统管理员
- DevOps工程师
学习收获
掌握Prometheus监控架构
精通数据采集与处理
学会告警管理与优化
祝您学习愉快!
学有所成,前程似锦!






