读前自测:你是不是也卡在“装好了但不会用”这一步

很多人接触 Prometheus,是照着博客把服务端和 node_exporter 装起来,打开界面看到一堆图表就以为入门了。但真到用的时候,问题一个接一个:想看某台机器的内存使用率,不知道 PromQL 怎么写;想给 CPU 飙高加个告警,不知道告警规则怎么配;业务指标想接入,只知道 pushgateway 这个名字,不清楚什么时候该用它、什么时候不该用。如果你正处于这种“能启动但不会查、会查但不会告警”的状态,这门课就是用来补齐这些具体短板的。

这门课在讲什么,先看哪几块最值

课程的定位很务实:不绕弯子,直接从监控体系里的核心能力逐项讲透。建议按下面顺序“先吃主食”:

  • 第一块:监控的定位与组件逻辑。开头几节讲的不是操作,而是帮你想明白“为什么需要监控”“Prometheus 在整个监控体系里负责什么”。这里不是废话铺垫,它决定了你后面遇到问题时能不能判断“该改 exporter、该改规则、还是该改告警”。
  • 第二块:从安装到指标看得见。包括服务端怎么装起来、node_exporter 是什么角色,以及用 PromQL 查 CPU、内存、磁盘、inode 这些基础指标。这一块做完,你至少能回答“这台机器现在的负载到底多少”“磁盘还能撑多久”。
  • 第三块:告警与自定义指标。这部分最有实操价值:alertmanager 配合钉钉和邮件发告警,以及 pushgateway 的适用场景、优缺点和自定义指标写法。看完之后,你会明确一件事——哪些指标不适合用 pushgateway 强推,从而避免在产品环境里埋坑。

如果时间有限,告警配置和 PromQL 两节优先看,因为它们最能在日常工作中直接解决“群里问机器是不是挂了”这类问题。

适合什么基础,学完能独立做什么

基础方面要求不高:会登录 Linux 服务器,能看懂常见的命令行反馈,就能跟上课程节奏。不需要你预先写过告警规则或了解时序数据库原理,遇到专业术语时课程会先解释再使用。

按部就班学完之后,你应当具备这些可验证的能力:

  • 独立部署一套 Prometheus + node_exporter,把机器指标采集上来。
  • 写得出常用的 PromQL 查询,能排查“内存到底是被谁吃掉了”这类问题。
  • 配置 alertmanager 的钉钉或邮件告警,让异常状态主动推送而不是靠人盯。
  • 判断哪些业务指标适合用 pushgateway 接入,并亲手实现一个简单的自定义指标采集。

资料怎么配合练习,才不会假学会

这套资料里包含的是视频加配套文档,建议不要光看。每看完一节,就针对三个动作做输出:第一,打开一个测试环境,把视频里讲的命令亲手敲一遍;第二,故意改坏配置,比如把告警阈值调成一个明显不合理的值,看看实际触发告警的表现,这比看十遍演示都管用;

课程目录

1-1 [基础篇] 序、prometheus课程简介 (08:20)
1-2 [基础篇] 序一、监控重要性 (10:40)
1-3 [基础篇] 一、prometheus是什么 (07:08)
1-4 [基础篇] 二、全家桶简介 (04:46)
1-5 [基础篇] 三、环境简介 server端安装 (15:36)
1-6 [基础篇] 四、node_export安装 (37:08)
1-7 [基础篇] 五、PromQL简介 (16:24)
1-8 [基础篇] 六、监控CPU内存磁盘inode (05:37)
1-9 [基础篇] 七、pushgateway优缺点及自定义指标采集 (25:00)
1-10 [基础篇] 八、alertmanager使用钉钉机器人告警 (19:56)
1-11 [基础篇] 九、alertmanager使用邮件告警 (06:08)
1-12 [基础篇] 十、其他exporter简介-windows-exporte (10:49)
2-1 [高级篇] 一、使用playbook进行**批量安装 (07:20)
2-2 [高级篇] 二、老顽固?静默设置 (04:33)
2-3 [高级篇] 三、联邦集群 (10:01)
2-4 [高级篇] 四、另类的自动发现 (08:17)
2-5 [高级篇] 五、优秀自洽 (04:16)
2-6 [高级篇] 六、自定义键 (04:37)
2-7 [高级篇] 七、labels妙用 (09:12)
2-8 [高级篇] 八、高可用 (02:23)
2-9 [高级篇] 九、故障自愈 (27:29)
2-10 [高级篇] 十、grafana展示 (07:12)