课程目录

1-1 [统一大数据分析引擎Spark介绍] Spark缘起 (07:11)
1-2 [统一大数据分析引擎Spark介绍] Google名字的由来 (09:10)
1-3 [统一大数据分析引擎Spark介绍] 大数据在Yahoo (11:37)
1-4 [统一大数据分析引擎Spark介绍] Spark的诞生背景 (09:43)
1-5 [统一大数据分析引擎Spark介绍] Spark光芒初露 (08:51)
1-6 [统一大数据分析引擎Spark介绍] 脱离了大数据的人工智能就是耍流氓 (09:47)
1-7 [统一大数据分析引擎Spark介绍] Spark的Speed (07:46)
1-8 [统一大数据分析引擎Spark介绍] Spark的易用性模块化及易扩展 (10:56)
1-9 [统一大数据分析引擎Spark介绍] 一统大数据分析 (09:06)
1-10 [统一大数据分析引擎Spark介绍] SparkSQL (08:14)
1-11 [统一大数据分析引擎Spark介绍] Structured Streaming (06:52)
1-12 [统一大数据分析引擎Spark介绍] MLlib (08:41)
1-13 [统一大数据分析引擎Spark介绍] GraphX (06:44)
1-14 [统一大数据分析引擎Spark介绍] 服务组件架构 (07:03)
1-15 [统一大数据分析引擎Spark介绍] Driver (10:51)
1-16 [统一大数据分析引擎Spark介绍] 部署模式yarn client和cluster的区别 (08:09)
1-17 [统一大数据分析引擎Spark介绍] 分布式数据分片 (08:43)
1-18 [统一大数据分析引擎Spark介绍] 开发者体验 (10:45)
1-19 [统一大数据分析引擎Spark介绍] 数据科学家 (08:00)
1-20 [统一大数据分析引擎Spark介绍] 数据工程师 (09:47)
1-21 [统一大数据分析引擎Spark介绍] 使用场景和社区发展 (12:14)
2-1 [下载试用Spark] 下载安装Spark (10:22)
2-2 [下载试用Spark] 安装包目录结构 (09:22)
2-3 [下载试用Spark] Scala和PySpark Shell试用 (10:49)
2-4 [下载试用Spark] 使用本地模式运行 (11:37)
2-5 [下载试用Spark] 需要了解的名词 (07:51)
2-6 [下载试用Spark] SparkApplication和SparkSession是 (10:20)
2-7 [下载试用Spark] 什么是转换动作和延迟执行 (11:39)
2-8 [下载试用Spark] 什么是宽窄依赖 (06:50)
2-9 [下载试用Spark] 初识SparkUI (08:54)
2-10 [下载试用Spark] 数砖Spark云和怎么运行示例代码 (06:49)
2-11 [下载试用Spark] 老师请吃牛奶巧克力豆 (14:56)
2-12 [下载试用Spark] 加利福尼亚的学生偏爱黄色 (13:54)
3-1 [结构化API] RDD到底是什么? (15:02)
3-2 [结构化API] RDD存在的问题 (09:41)
3-3 [结构化API] 高阶低阶API对比 (09:34)
3-4 [结构化API] 如果高阶API不能满足需要该怎么办? (06:38)
3-5 [结构化API] DataFrame API (06:04)
3-6 [结构化API] DataTypes (07:12)
3-7 [结构化API] 定义Schema创建DataFrame (10:53)
3-8 [结构化API] 列和表达式 (10:38)
3-9 [结构化API] Rows (11:41)
3-10 [结构化API] DataFrame常用操作 (09:54)
3-11 [结构化API] 怎么把DataFrame保存到Parquet文件或数据库表中 (07:20)
3-12 [结构化API] DataFrame的转换和动作操作 (10:01)
3-13 [结构化API] 增删改DataFrames列 (10:56)
3-14 [结构化API] 修改DataFrames列的数据类型 (07:22)
3-15 [结构化API] DataFrame聚合操作 (12:28)
3-16 [结构化API] DataFrame其它练习 (06:28)
3-17 [结构化API] DataSet (09:51)
3-18 [结构化API] 怎么创建DataSet (11:36)
3-19 [结构化API] DataSet使用示例 (08:09)
3-20 [结构化API] 啥时候用RDD呢? (10:15)
3-21 [结构化API] Catalyst优化 (11:51)
4-1 [SparkSql和DataFrames: 内置数据源介绍] SparkSql (07:53)
4-2 [SparkSql和DataFrames: 内置数据源介绍] 在Spark应用中使用SparkSql (15:04)
4-3 [SparkSql和DataFrames: 内置数据源介绍] Sql简单查询示例 (09:36)
4-4 [SparkSql和DataFrames: 内置数据源介绍] Sql创建表和视图 (06:35)
4-5 [SparkSql和DataFrames: 内置数据源介绍] 创建数据库和表 (06:12)
4-6 [SparkSql和DataFrames: 内置数据源介绍] 创建非管理的表和视图 (09:23)
4-7 [SparkSql和DataFrames: 内置数据源介绍] 全局视图和普通视图的区别 (08:35)
4-8 [SparkSql和DataFrames: 内置数据源介绍] 缓存表 (07:53)
4-9 [SparkSql和DataFrames: 内置数据源介绍] Sql数据源 (07:11)
4-10 [SparkSql和DataFrames: 内置数据源介绍] read和readStream的区别 (08:49)
4-11 [SparkSql和DataFrames: 内置数据源介绍] DataFrameWriter (13:26)
4-12 [SparkSql和DataFrames: 内置数据源介绍] 写Parquet (12:13)
5-1 [Spark SQL和DataFrames:操作外部数据源] 操作外部数据源 (10:14)
5-2 [Spark SQL和DataFrames:操作外部数据源] 自定义函数 (10:46)
5-3 [Spark SQL和DataFrames:操作外部数据源] SQL执行顺序和空值判断 (15:42)
5-4 [Spark SQL和DataFrames:操作外部数据源] 示例Stage图 (05:22)
5-5 [Spark SQL和DataFrames:操作外部数据源] 执行SparkSql的几种方式 (08:54)
5-6 [Spark SQL和DataFrames:操作外部数据源] Spark Shell使用 (08:32)
5-7 [Spark SQL和DataFrames:操作外部数据源] Beeline使用 (09:07)
5-8 [Spark SQL和DataFrames:操作外部数据源] Tableau使用 (05:24)
5-9 [Spark SQL和DataFrames:操作外部数据源] 连接外部数据源 (10:30)
5-10 [Spark SQL和DataFrames:操作外部数据源] 设置分区的重要性 (15:00)
5-11 [Spark SQL和DataFrames:操作外部数据源] 从Postgre等数据库读取数据 (06:55)
5-12 [Spark SQL和DataFrames:操作外部数据源] 处理复杂数据的两种方式 (12:41)
5-13 [Spark SQL和DataFrames:操作外部数据源] 内置处理复杂数据函数 (04:11)
5-14 [Spark SQL和DataFrames:操作外部数据源] 高阶函数 (09:25)
5-15 [Spark SQL和DataFrames:操作外部数据源] 联合关联窗口函数和修改 (14:33)
6-1 [Spark SQL 和 Datasets] SparkSql和Datasets (11:08)
6-2 [Spark SQL 和 Datasets] Scala样例类和JavaBean (11:50)
6-3 [Spark SQL 和 Datasets] 怎么使用Datasets (10:41)
6-4 [Spark SQL 和 Datasets] 高阶函数和函数式编程范式 (07:20)
6-5 [Spark SQL 和 Datasets] 同时显示用户和成本信息及使用高阶函数的注意事项 (13:52)
6-6 [Spark SQL 和 Datasets] Dataframe转Dataset及Spark内存管理演进 (11:10)
6-7 [Spark SQL 和 Datasets] Dataset编码器 (15:02)
6-8 [Spark SQL 和 Datasets] 使用Dataset的成本和降低成本的方法 (07:48)
7-1 [调节调优Spark应用] Spark调优 (06:49)
7-2 [调节调优Spark应用] 修改配置的3种方式 (08:46)
7-3 [调节调优Spark应用] 检查配置是否可修改 (10:37)
7-4 [调节调优Spark应用] 静态和动态资源分配 (08:50)
7-5 [调节调优Spark应用] Excutor和shuffle服务设置 (14:58)
7-6 [调节调优Spark应用] 最大化并行度 (07:49)
7-7 [调节调优Spark应用] 分区是怎么产生的 (09:40)
7-8 [调节调优Spark应用] 性能调优的神奇公式 (03:55)
7-9 [调节调优Spark应用] cache和persist (06:36)
7-10 [调节调优Spark应用] DataFrame cache和注意事项 (08:55)
7-11 [调节调优Spark应用] cache persist这是一个问题 (10:39)
7-12 [调节调优Spark应用] Spark join相关优化 (11:50)
8-1 [Structured Streaming] Structured Streaming (08:48)
8-2 [Structured Streaming] 微批处理是怎么诞生地 (10:11)
8-3 [Structured Streaming] 为什么微批处理是实用的? (09:03)
8-4 [Structured Streaming] 从DStreams中学到了什么? (11:16)
8-5 [Structured Streaming] Structured Streaming编程模型 (11:20)
8-6 [Structured Streaming] Structured Streaming基础 (06:50)
8-7 [Structured Streaming] 简单5步创建Streaming应用 (12:35)
8-8 [Structured Streaming] 怎么设置输出端和输出模式 (11:16)
8-9 [Structured Streaming] 深入理解Structured Streaming查询过程 (10:39)
8-10 [Structured Streaming] 在什么情况下循环会停止? (11:17)
8-11 [Structured Streaming] 保证数据只被处理一次需要哪些条件? (11:38)
8-12 [Structured Streaming] 怎么监控查询运行状态? (08:57)
8-13 [Structured Streaming] 怎么自定义监控指标和读取文件? (10:33)
8-14 [Structured Streaming] 读取文件有那些注意事项和怎么写文件? (13:51)
8-15 [Structured Streaming] 怎么使用StructuredStreaming操作Kafka (10:48)
8-16 [Structured Streaming] 关于怎么操作Kafka的更多信息 (02:11)
8-17 [Structured Streaming] 怎么为Structured Streaming自定义输入输出 (09:41)
8-18 [Structured Streaming] 怎么使用foreachBach想往哪写往那写 (10:01)
8-19 [Structured Streaming] 怎么使用foreach想往哪写往那写 (05:42)
8-20 [Structured Streaming] 流的数据转换操作 (11:21)
8-21 [Structured Streaming] 什么是有状态的和无状态的流操作 (09:09)
8-22 [Structured Streaming] 深入理解有状态的流操作 (11:57)
8-23 [Structured Streaming] 分布式状态管理和容错 (06:44)
8-24 [Structured Streaming] 有状态的流又有哪些类别 (09:20)
8-25 [Structured Streaming] 什么是全局的聚合操作 (10:21)
8-26 [Structured Streaming] 基于时间窗口的统计 (10:03)
8-27 [Structured Streaming] 图示基于时间窗口的统计执行过程 (11:33)
8-28 [Structured Streaming] 啥子是水位标记 (08:49)
8-29 [Structured Streaming] 基于时间窗口统计的保障和三种输出模式的注意事项 (13:17)
8-30 [Structured Streaming] 流关联静态数据集 (12:32)
8-31 [Structured Streaming] 流静关联注意事项和流流关联 (09:07)
8-32 [Structured Streaming] 流流内连接和可选的水位线 (12:49)
8-33 [Structured Streaming] 怎么随意编写有状态的计算 (14:46)
8-34 [Structured Streaming] 新增方法mapGroupsWithState代码示例 (12:54)
8-35 [Structured Streaming] 使用Timeout处理不活跃的组 (09:04)
8-36 [Structured Streaming] flatMapGroupsWithState及流查询调优 (13:26)
9-1 [使用Spark构建可靠的数据湖] 怎么使用Spark构建可靠的数据湖 (12:57)
9-2 [使用Spark构建可靠的数据湖] 选择合适存储方案的重要性 (11:06)
9-3 [使用Spark构建可靠的数据湖] 简单介绍下数据库 (12:45)
9-4 [使用Spark构建可靠的数据湖] 数据库的局限 (15:00)
9-5 [使用Spark构建可靠的数据湖] 数据湖简介 (14:52)
9-6 [使用Spark构建可靠的数据湖] 一个构建数据湖的选择题 (15:16)
9-7 [使用Spark构建可靠的数据湖] 数据湖的局限 (09:52)
9-8 [使用Spark构建可靠的数据湖] 怎么绕过数据湖存在的问题 (08:06)
9-9 [使用Spark构建可靠的数据湖] 更先进的存储解决方案Lakehouses (16:22)
9-10 [使用Spark构建可靠的数据湖] ApacheHudi和Iceberg (16:03)
9-11 [使用Spark构建可靠的数据湖] DeltaLake (09:45)
9-12 [使用Spark构建可靠的数据湖] 使用Spark在三角州上建造湖边小屋 (13:51)
9-13 [使用Spark构建可靠的数据湖] 怎么使用Spark写数据到DeltaLake的表 (14:38)
9-14 [使用Spark构建可靠的数据湖] 强制Schema一致的好处 (10:16)
9-15 [使用Spark构建可靠的数据湖] 操作存量数据 (20:47)
10-1 [使用MLlib进行机器学习] 什么是机器学习和监督学习 (15:12)
10-2 [使用MLlib进行机器学习] 什么是无监督学习 (12:41)
10-3 [使用MLlib进行机器学习] 怎么使用Spark进行机器学习 (10:09)
10-4 [使用MLlib进行机器学习] 怎么设计构建机器学习管道 (13:56)
10-5 [使用MLlib进行机器学习] 啥是转换器估量器和管道 (14:55)
10-6 [使用MLlib进行机器学习] 获取探索数据及训练集和测试集 (14:37)
10-7 [使用MLlib进行机器学习] 怎么保证每次执行训练集和测试集不变 (06:48)
10-8 [使用MLlib进行机器学习] 怎么为转换器准备所需特征 (09:49)
10-9 [使用MLlib进行机器学习] 认识线性回归 (09:14)
10-10 [使用MLlib进行机器学习] 怎么使用估量器构建模型 (07:59)
10-11 [使用MLlib进行机器学习] 为什么需要管道 (09:08)
10-12 [使用MLlib进行机器学习] OHE? (11:18)
10-13 [使用MLlib进行机器学习] 稀疏向量工作原理 (12:20)
10-14 [使用MLlib进行机器学习] 怎么处理新遇到的分类值和怎么自动转换分类值 (09:07)
10-15 [使用MLlib进行机器学习] 使用RFormula的注意事项 (09:22)
10-16 [使用MLlib进行机器学习] 小时候学的最小平方差用上了吧 (09:56)
10-17 [使用MLlib进行机器学习] RMSE结果分析 (07:55)
10-18 [使用MLlib进行机器学习] R平方的取值有负数合理不? (09:02)
10-19 [使用MLlib进行机器学习] 怎么保存和读取模型 (06:41)
10-20 [使用MLlib进行机器学习] 调节超参数 (06:52)
10-21 [使用MLlib进行机器学习] 什么是决策树 (12:07)
10-22 [使用MLlib进行机器学习] 树的深度和怎么查看学习到的规则 (14:53)
10-23 [使用MLlib进行机器学习] 怎么查看哪个特征影响比较大 (07:21)
10-24 [使用MLlib进行机器学习] 什么是随机森林 (14:47)
10-25 [使用MLlib进行机器学习] 随机森林数据处理图示 (08:06)
10-26 [使用MLlib进行机器学习] 什么是K交叉验证 (14:58)
10-27 [使用MLlib进行机器学习] 怎么加快模型验证速度 (10:27)
11-1 [使用Spark管理部署扩展机器学习模型] 使用Spark管理部署扩展机器学习模型 (14:09)
11-2 [使用Spark管理部署扩展机器学习模型] 并行计算也有可能影响模型的可复现性 (08:58)
11-3 [使用Spark管理部署扩展机器学习模型] MLflow是什么 (14:39)
11-4 [使用Spark管理部署扩展机器学习模型] 怎么使用MLflow记录Run信息 (08:58)
11-5 [使用Spark管理部署扩展机器学习模型] 模型部署模式 (08:27)
11-6 [使用Spark管理部署扩展机器学习模型] 批处理和注意事项 (12:37)
11-7 [使用Spark管理部署扩展机器学习模型] 流式处理的利弊 (10:32)
11-8 [使用Spark管理部署扩展机器学习模型] 需要实时预测咋整 (07:01)
11-9 [使用Spark管理部署扩展机器学习模型] Spark还可以在机器学习中这么用 (09:06)
12-1 [Apache Spark 3.0新功能] Apache Spark 3.0 (15:15)
12-2 [Apache Spark 3.0新功能] 新功能查询执行时动态调整 (08:42)
12-3 [Apache Spark 3.0新功能] 新功能SQL建议语句 (10:35)
12-4 [Apache Spark 3.0新功能] Structured Streaming新功能 (07:37)
12-5 [Apache Spark 3.0新功能] Python API变更 (07:02)
12-6 [Apache Spark 3.0新功能] DataFrame和DataSet变更 (09:42)
12-7 [Apache Spark 3.0新功能] 大结局本书完 (11:19)