稳定性工程不是“背锅侠”的进阶版

很多人对 SRE(站点可靠性工程)存在误解,认为它是运维的高阶形态,或者是一个无所不能的救火队角色。但这门课程首先要纠正的就是这个认知偏差。SRE 的核心不在于技术栈的深度堆叠,而在于用工程化的思维去量化和管理系统的“不确定性”。对于正在备考高阶运维岗位,或者在转岗 IT 基础设施领域时感到迷茫的技术学习者来说,这门课解决的根本问题是:**如何从“被动响应故障”转向“主动管理风险”**。它不教你怎么写代码,而是教你怎么定义“什么是好的系统”,以及如何与业务方就“允许多少故障”达成共识。

先懂度量,再谈响应

这门课适合具备一定系统运维基础、但缺乏系统性稳定性方法论的学习者。如果你是纯开发背景,可能对 SLI/SLO 的概念较陌生;如果你已经是老运维,可能正卡在“忙而无功”的职业瓶颈上。建议的学习路径是:先夯实**基础篇**的 01 到 04 讲。

这部分内容虽然理论性强,但是整个体系的基石。你需要重点理解 SLI(服务等级指标)和 SLO(服务等级目标)的区别与联系,以及“错误预算”这一核心概念。错误预算不只是算账,它是一种达成共识的机制——告诉开发团队,如果预算花光了,就得暂停新功能开发来修复稳定性问题。看完这部分,你应该能回答:“当业务方要求 99.99% 可用性时,我应该用什么指标去衡量?如果资源有限,如何谈判?”

**实践篇**则聚焦于故障发生后的闭环。从 06 讲 On-Call 机制的建设,到 07 讲故障恢复的优先级,再到 08 讲的复盘方法论,这是一套完整的应急流程。建议结合案例篇(05、09、10 讲)一起看,了解大厂典型的 SRE 组织架构和协作机制,从而理解理论与实践落地的差距。

学完能独立做什么

完成本课程后,你不应只会复述概念,而应能独立承担以下工作:

1. **设计监控体系**:能为一个核心服务制定合理的 SLI,并设定可执行、可量化的 SLO 目标。
2. **管理错误预算**:能在跨部门协作中,用错误预算数据支撑稳定性决策,平衡功能迭代与系统稳定。
3. **主导故障处理流程**:在故障发生时,能依据“恢复优先”原则组织 On-Call,并在事后推动有效的复盘(Post-mortem),避免同类故障再次发生。
4. **优化协作机制**:能参考成熟案例,优化所在团队的 SRE 协作流程,减少沟通成本。

配套的练习资料并非简单的代码脚本,而是围绕 SLI 设定、错误预算计算、复盘报告撰写等场景的设计题。建议在学习过程中,尝试为你熟悉的一个系统草拟一份 SLO 文档,这将帮助你把抽象概念转化为实际能力。

课程目录

开篇词 (1讲)

  1. 开篇词|SRE是解决系统稳定性问题的灵丹妙药吗?

基础篇 (5讲)

  1. 01|SRE迷思:无所不能的角色?还是运维的升级?
  2. 02 _ 系统可用性:没有故障,系统就一定是稳定的吗?
  3. 03 _ SRE切入点:选择SLI,设定SLO
  4. 04 _ 错误预算:达成稳定性目标的共识机制
  5. 05 _ 案例:落地SLO时还需要考虑哪些因素?

实践篇 (5讲)

  1. 06 _ 故障发现:如何建设On-Call机制?
  2. 07|故障处理:一切以恢复业务为最高优先级
  3. 08|故障复盘:黄金三问与判定三原则
  4. 09|案例:互联网典型的SRE组织架构是怎样的?
  5. 10 _ 经验:都有哪些高效的SRE组织协作机制?

结束语 (2讲)

  1. 答疑|没什么能阻挡你拓展边界的渴望
  2. 结束语|聊聊我的SRE落地心路历程