Velero 管理 Kubernetes 备份和还原:能力缺口与学习路径
对于运维或开发人员,Kubernetes 环境中的数据备份与还原是基础能力,但原生工具复杂且易出错。Velero 作为 Kubernetes 官方推荐的备份工具,整合了多种存储后端,但实际应用中常常因存储集成、权限配置、恢复场景复杂导致问题。这门课聚焦 Velero 的核心功能与实战,适合已有 Kubernetes 基础(如熟悉 Pod、Namespace、PV/STorageClass 基本概念),但缺乏备份实践的学习者。重点解决存储后端(如 Ceph)与 Velero 的集成难点,以及状态卷(PV)数据的备份还原问题。如果你当前无法独立完成 K8s 应用状态的有效备份,或对跨存储后端还原操作感到困难,这门课能有效弥补你的能力缺口。
学习顺序与配套练习
课程内容从 Ceph 存储部署(第 2-6 节)入手,为需要从零搭建存储的学习者提供完整步骤,已有现成 Ceph 环境的用户可适当跳过。核心部分从第 7 节 Velero 部署开始,涵盖备份命令参数、资源选择(`--include-resources`、`--exclude-resources`)、存储类(StorageClass)选择等关键操作。第 8 节通过还原验证备份有效性,是检查 Velero 配置正确性的必经环节。第 9 节定时备份涉及 `velero schedule create` 命令与 Job CRD 的交互,建议结合实际集群的 Job 控制器进行理解。配套练习重点包括:手动创建 Ceph 对象存储桶并配置访问密钥供 Velero 使用;验证块存储/文件系统挂载后的备份效果差异;尝试还原到不同命名空间或指定 `StorageClass` 的 PV,并排查失败原因(如权限不足、网络问题)。这些练习旨在强化对 Velero 与底层存储交互逻辑的理解。资料配合方面,建议优先学习 2-5 节理解 Ceph 存储与 K8s 集成的底层逻辑,7-8 节掌握备份命令参数与验证流程。
核心内容与独立操作能力
第 10-12 节的 PV 数据备份还原与跨集群迁移是关键,需动手完成:将备份恢复到不同命名空间、更换目标存储类,以及处理跨集群还原的配置问题(如修改 `restic`仓库地址、认证信息)。第 13 节 Velero hook 的讲解提供了扩展功能的方法,例如在还原前自动扩容相关资源,或后置清理任务。学完后,你应能独立完成:为生产环境搭建包含 Ceph 的 Velero 备份架构,制定满足 RPO/RTO 要求的备份策略(如每日全量+每小时增量),并解决常见的还原失败问题(如资源冲突、存储容量不足)。对于需要处理 PV 数据备份的学习者,建议重点理解 Ceph 对象存储与 Velero `restic`插件的工作方式,并结合课程提供的 hook 示例,尝试编写符合自身业务需求的自动化脚本。
课程目录
1 velero介绍及实验环境要求 (05:35) 2 ceph集群部署 (15:58) 3 ceph块存储和k8s集成 (15:02) 4 ceph FS系统和k8s集成 (10:50) 5 ceph对象存储创建 (12:37) 6 velero部署详解 (13:25) 7 k8s集群备份还原一 (07:47) 8 k8s集群备份还原二 (11:44) 9 k8s定时备份 (09:37) 10 k8s集群资源迁移 (15:41) 11 velero和restic集成备份pv数据 (15:44) 12 还原到不同名称空间和存储类 (16:26) 13 velero pre和post hook (07:40)




