课程目录
1-1 [统一大数据分析引擎Spark介绍] Spark缘起 (07:11) 1-2 [统一大数据分析引擎Spark介绍] Google名字的由来 (09:10) 1-3 [统一大数据分析引擎Spark介绍] 大数据在Yahoo (11:37) 1-4 [统一大数据分析引擎Spark介绍] Spark的诞生背景 (09:43) 1-5 [统一大数据分析引擎Spark介绍] Spark光芒初露 (08:51) 1-6 [统一大数据分析引擎Spark介绍] 脱离了大数据的人工智能就是耍流氓 (09:47) 1-7 [统一大数据分析引擎Spark介绍] Spark的Speed (07:46) 1-8 [统一大数据分析引擎Spark介绍] Spark的易用性模块化及易扩展 (10:56) 1-9 [统一大数据分析引擎Spark介绍] 一统大数据分析 (09:06) 1-10 [统一大数据分析引擎Spark介绍] SparkSQL (08:14) 1-11 [统一大数据分析引擎Spark介绍] Structured Streaming (06:52) 1-12 [统一大数据分析引擎Spark介绍] MLlib (08:41) 1-13 [统一大数据分析引擎Spark介绍] GraphX (06:44) 1-14 [统一大数据分析引擎Spark介绍] 服务组件架构 (07:03) 1-15 [统一大数据分析引擎Spark介绍] Driver (10:51) 1-16 [统一大数据分析引擎Spark介绍] 部署模式yarn client和cluster的区别 (08:09) 1-17 [统一大数据分析引擎Spark介绍] 分布式数据分片 (08:43) 1-18 [统一大数据分析引擎Spark介绍] 开发者体验 (10:45) 1-19 [统一大数据分析引擎Spark介绍] 数据科学家 (08:00) 1-20 [统一大数据分析引擎Spark介绍] 数据工程师 (09:47) 1-21 [统一大数据分析引擎Spark介绍] 使用场景和社区发展 (12:14) 2-1 [下载试用Spark] 下载安装Spark (10:22) 2-2 [下载试用Spark] 安装包目录结构 (09:22) 2-3 [下载试用Spark] Scala和PySpark Shell试用 (10:49) 2-4 [下载试用Spark] 使用本地模式运行 (11:37) 2-5 [下载试用Spark] 需要了解的名词 (07:51) 2-6 [下载试用Spark] SparkApplication和SparkSession是 (10:20) 2-7 [下载试用Spark] 什么是转换动作和延迟执行 (11:39) 2-8 [下载试用Spark] 什么是宽窄依赖 (06:50) 2-9 [下载试用Spark] 初识SparkUI (08:54) 2-10 [下载试用Spark] 数砖Spark云和怎么运行示例代码 (06:49) 2-11 [下载试用Spark] 老师请吃牛奶巧克力豆 (14:56) 2-12 [下载试用Spark] 加利福尼亚的学生偏爱黄色 (13:54) 3-1 [结构化API] RDD到底是什么? (15:02) 3-2 [结构化API] RDD存在的问题 (09:41) 3-3 [结构化API] 高阶低阶API对比 (09:34) 3-4 [结构化API] 如果高阶API不能满足需要该怎么办? (06:38) 3-5 [结构化API] DataFrame API (06:04) 3-6 [结构化API] DataTypes (07:12) 3-7 [结构化API] 定义Schema创建DataFrame (10:53) 3-8 [结构化API] 列和表达式 (10:38) 3-9 [结构化API] Rows (11:41) 3-10 [结构化API] DataFrame常用操作 (09:54) 3-11 [结构化API] 怎么把DataFrame保存到Parquet文件或数据库表中 (07:20) 3-12 [结构化API] DataFrame的转换和动作操作 (10:01) 3-13 [结构化API] 增删改DataFrames列 (10:56) 3-14 [结构化API] 修改DataFrames列的数据类型 (07:22) 3-15 [结构化API] DataFrame聚合操作 (12:28) 3-16 [结构化API] DataFrame其它练习 (06:28) 3-17 [结构化API] DataSet (09:51) 3-18 [结构化API] 怎么创建DataSet (11:36) 3-19 [结构化API] DataSet使用示例 (08:09) 3-20 [结构化API] 啥时候用RDD呢? (10:15) 3-21 [结构化API] Catalyst优化 (11:51) 4-1 [SparkSql和DataFrames: 内置数据源介绍] SparkSql (07:53) 4-2 [SparkSql和DataFrames: 内置数据源介绍] 在Spark应用中使用SparkSql (15:04) 4-3 [SparkSql和DataFrames: 内置数据源介绍] Sql简单查询示例 (09:36) 4-4 [SparkSql和DataFrames: 内置数据源介绍] Sql创建表和视图 (06:35) 4-5 [SparkSql和DataFrames: 内置数据源介绍] 创建数据库和表 (06:12) 4-6 [SparkSql和DataFrames: 内置数据源介绍] 创建非管理的表和视图 (09:23) 4-7 [SparkSql和DataFrames: 内置数据源介绍] 全局视图和普通视图的区别 (08:35) 4-8 [SparkSql和DataFrames: 内置数据源介绍] 缓存表 (07:53) 4-9 [SparkSql和DataFrames: 内置数据源介绍] Sql数据源 (07:11) 4-10 [SparkSql和DataFrames: 内置数据源介绍] read和readStream的区别 (08:49) 4-11 [SparkSql和DataFrames: 内置数据源介绍] DataFrameWriter (13:26) 4-12 [SparkSql和DataFrames: 内置数据源介绍] 写Parquet (12:13) 5-1 [Spark SQL和DataFrames:操作外部数据源] 操作外部数据源 (10:14) 5-2 [Spark SQL和DataFrames:操作外部数据源] 自定义函数 (10:46) 5-3 [Spark SQL和DataFrames:操作外部数据源] SQL执行顺序和空值判断 (15:42) 5-4 [Spark SQL和DataFrames:操作外部数据源] 示例Stage图 (05:22) 5-5 [Spark SQL和DataFrames:操作外部数据源] 执行SparkSql的几种方式 (08:54) 5-6 [Spark SQL和DataFrames:操作外部数据源] Spark Shell使用 (08:32) 5-7 [Spark SQL和DataFrames:操作外部数据源] Beeline使用 (09:07) 5-8 [Spark SQL和DataFrames:操作外部数据源] Tableau使用 (05:24) 5-9 [Spark SQL和DataFrames:操作外部数据源] 连接外部数据源 (10:30) 5-10 [Spark SQL和DataFrames:操作外部数据源] 设置分区的重要性 (15:00) 5-11 [Spark SQL和DataFrames:操作外部数据源] 从Postgre等数据库读取数据 (06:55) 5-12 [Spark SQL和DataFrames:操作外部数据源] 处理复杂数据的两种方式 (12:41) 5-13 [Spark SQL和DataFrames:操作外部数据源] 内置处理复杂数据函数 (04:11) 5-14 [Spark SQL和DataFrames:操作外部数据源] 高阶函数 (09:25) 5-15 [Spark SQL和DataFrames:操作外部数据源] 联合关联窗口函数和修改 (14:33) 6-1 [Spark SQL 和 Datasets] SparkSql和Datasets (11:08) 6-2 [Spark SQL 和 Datasets] Scala样例类和JavaBean (11:50) 6-3 [Spark SQL 和 Datasets] 怎么使用Datasets (10:41) 6-4 [Spark SQL 和 Datasets] 高阶函数和函数式编程范式 (07:20) 6-5 [Spark SQL 和 Datasets] 同时显示用户和成本信息及使用高阶函数的注意事项 (13:52) 6-6 [Spark SQL 和 Datasets] Dataframe转Dataset及Spark内存管理演进 (11:10) 6-7 [Spark SQL 和 Datasets] Dataset编码器 (15:02) 6-8 [Spark SQL 和 Datasets] 使用Dataset的成本和降低成本的方法 (07:48) 7-1 [调节调优Spark应用] Spark调优 (06:49) 7-2 [调节调优Spark应用] 修改配置的3种方式 (08:46) 7-3 [调节调优Spark应用] 检查配置是否可修改 (10:37) 7-4 [调节调优Spark应用] 静态和动态资源分配 (08:50) 7-5 [调节调优Spark应用] Excutor和shuffle服务设置 (14:58) 7-6 [调节调优Spark应用] 最大化并行度 (07:49) 7-7 [调节调优Spark应用] 分区是怎么产生的 (09:40) 7-8 [调节调优Spark应用] 性能调优的神奇公式 (03:55) 7-9 [调节调优Spark应用] cache和persist (06:36) 7-10 [调节调优Spark应用] DataFrame cache和注意事项 (08:55) 7-11 [调节调优Spark应用] cache persist这是一个问题 (10:39) 7-12 [调节调优Spark应用] Spark join相关优化 (11:50) 8-1 [Structured Streaming] Structured Streaming (08:48) 8-2 [Structured Streaming] 微批处理是怎么诞生地 (10:11) 8-3 [Structured Streaming] 为什么微批处理是实用的? (09:03) 8-4 [Structured Streaming] 从DStreams中学到了什么? (11:16) 8-5 [Structured Streaming] Structured Streaming编程模型 (11:20) 8-6 [Structured Streaming] Structured Streaming基础 (06:50) 8-7 [Structured Streaming] 简单5步创建Streaming应用 (12:35) 8-8 [Structured Streaming] 怎么设置输出端和输出模式 (11:16) 8-9 [Structured Streaming] 深入理解Structured Streaming查询过程 (10:39) 8-10 [Structured Streaming] 在什么情况下循环会停止? (11:17) 8-11 [Structured Streaming] 保证数据只被处理一次需要哪些条件? (11:38) 8-12 [Structured Streaming] 怎么监控查询运行状态? (08:57) 8-13 [Structured Streaming] 怎么自定义监控指标和读取文件? (10:33) 8-14 [Structured Streaming] 读取文件有那些注意事项和怎么写文件? (13:51) 8-15 [Structured Streaming] 怎么使用StructuredStreaming操作Kafka (10:48) 8-16 [Structured Streaming] 关于怎么操作Kafka的更多信息 (02:11) 8-17 [Structured Streaming] 怎么为Structured Streaming自定义输入输出 (09:41) 8-18 [Structured Streaming] 怎么使用foreachBach想往哪写往那写 (10:01) 8-19 [Structured Streaming] 怎么使用foreach想往哪写往那写 (05:42) 8-20 [Structured Streaming] 流的数据转换操作 (11:21) 8-21 [Structured Streaming] 什么是有状态的和无状态的流操作 (09:09) 8-22 [Structured Streaming] 深入理解有状态的流操作 (11:57) 8-23 [Structured Streaming] 分布式状态管理和容错 (06:44) 8-24 [Structured Streaming] 有状态的流又有哪些类别 (09:20) 8-25 [Structured Streaming] 什么是全局的聚合操作 (10:21) 8-26 [Structured Streaming] 基于时间窗口的统计 (10:03) 8-27 [Structured Streaming] 图示基于时间窗口的统计执行过程 (11:33) 8-28 [Structured Streaming] 啥子是水位标记 (08:49) 8-29 [Structured Streaming] 基于时间窗口统计的保障和三种输出模式的注意事项 (13:17) 8-30 [Structured Streaming] 流关联静态数据集 (12:32) 8-31 [Structured Streaming] 流静关联注意事项和流流关联 (09:07) 8-32 [Structured Streaming] 流流内连接和可选的水位线 (12:49) 8-33 [Structured Streaming] 怎么随意编写有状态的计算 (14:46) 8-34 [Structured Streaming] 新增方法mapGroupsWithState代码示例 (12:54) 8-35 [Structured Streaming] 使用Timeout处理不活跃的组 (09:04) 8-36 [Structured Streaming] flatMapGroupsWithState及流查询调优 (13:26) 9-1 [使用Spark构建可靠的数据湖] 怎么使用Spark构建可靠的数据湖 (12:57) 9-2 [使用Spark构建可靠的数据湖] 选择合适存储方案的重要性 (11:06) 9-3 [使用Spark构建可靠的数据湖] 简单介绍下数据库 (12:45) 9-4 [使用Spark构建可靠的数据湖] 数据库的局限 (15:00) 9-5 [使用Spark构建可靠的数据湖] 数据湖简介 (14:52) 9-6 [使用Spark构建可靠的数据湖] 一个构建数据湖的选择题 (15:16) 9-7 [使用Spark构建可靠的数据湖] 数据湖的局限 (09:52) 9-8 [使用Spark构建可靠的数据湖] 怎么绕过数据湖存在的问题 (08:06) 9-9 [使用Spark构建可靠的数据湖] 更先进的存储解决方案Lakehouses (16:22) 9-10 [使用Spark构建可靠的数据湖] ApacheHudi和Iceberg (16:03) 9-11 [使用Spark构建可靠的数据湖] DeltaLake (09:45) 9-12 [使用Spark构建可靠的数据湖] 使用Spark在三角州上建造湖边小屋 (13:51) 9-13 [使用Spark构建可靠的数据湖] 怎么使用Spark写数据到DeltaLake的表 (14:38) 9-14 [使用Spark构建可靠的数据湖] 强制Schema一致的好处 (10:16) 9-15 [使用Spark构建可靠的数据湖] 操作存量数据 (20:47) 10-1 [使用MLlib进行机器学习] 什么是机器学习和监督学习 (15:12) 10-2 [使用MLlib进行机器学习] 什么是无监督学习 (12:41) 10-3 [使用MLlib进行机器学习] 怎么使用Spark进行机器学习 (10:09) 10-4 [使用MLlib进行机器学习] 怎么设计构建机器学习管道 (13:56) 10-5 [使用MLlib进行机器学习] 啥是转换器估量器和管道 (14:55) 10-6 [使用MLlib进行机器学习] 获取探索数据及训练集和测试集 (14:37) 10-7 [使用MLlib进行机器学习] 怎么保证每次执行训练集和测试集不变 (06:48) 10-8 [使用MLlib进行机器学习] 怎么为转换器准备所需特征 (09:49) 10-9 [使用MLlib进行机器学习] 认识线性回归 (09:14) 10-10 [使用MLlib进行机器学习] 怎么使用估量器构建模型 (07:59) 10-11 [使用MLlib进行机器学习] 为什么需要管道 (09:08) 10-12 [使用MLlib进行机器学习] OHE? (11:18) 10-13 [使用MLlib进行机器学习] 稀疏向量工作原理 (12:20) 10-14 [使用MLlib进行机器学习] 怎么处理新遇到的分类值和怎么自动转换分类值 (09:07) 10-15 [使用MLlib进行机器学习] 使用RFormula的注意事项 (09:22) 10-16 [使用MLlib进行机器学习] 小时候学的最小平方差用上了吧 (09:56) 10-17 [使用MLlib进行机器学习] RMSE结果分析 (07:55) 10-18 [使用MLlib进行机器学习] R平方的取值有负数合理不? (09:02) 10-19 [使用MLlib进行机器学习] 怎么保存和读取模型 (06:41) 10-20 [使用MLlib进行机器学习] 调节超参数 (06:52) 10-21 [使用MLlib进行机器学习] 什么是决策树 (12:07) 10-22 [使用MLlib进行机器学习] 树的深度和怎么查看学习到的规则 (14:53) 10-23 [使用MLlib进行机器学习] 怎么查看哪个特征影响比较大 (07:21) 10-24 [使用MLlib进行机器学习] 什么是随机森林 (14:47) 10-25 [使用MLlib进行机器学习] 随机森林数据处理图示 (08:06) 10-26 [使用MLlib进行机器学习] 什么是K交叉验证 (14:58) 10-27 [使用MLlib进行机器学习] 怎么加快模型验证速度 (10:27) 11-1 [使用Spark管理部署扩展机器学习模型] 使用Spark管理部署扩展机器学习模型 (14:09) 11-2 [使用Spark管理部署扩展机器学习模型] 并行计算也有可能影响模型的可复现性 (08:58) 11-3 [使用Spark管理部署扩展机器学习模型] MLflow是什么 (14:39) 11-4 [使用Spark管理部署扩展机器学习模型] 怎么使用MLflow记录Run信息 (08:58) 11-5 [使用Spark管理部署扩展机器学习模型] 模型部署模式 (08:27) 11-6 [使用Spark管理部署扩展机器学习模型] 批处理和注意事项 (12:37) 11-7 [使用Spark管理部署扩展机器学习模型] 流式处理的利弊 (10:32) 11-8 [使用Spark管理部署扩展机器学习模型] 需要实时预测咋整 (07:01) 11-9 [使用Spark管理部署扩展机器学习模型] Spark还可以在机器学习中这么用 (09:06) 12-1 [Apache Spark 3.0新功能] Apache Spark 3.0 (15:15) 12-2 [Apache Spark 3.0新功能] 新功能查询执行时动态调整 (08:42) 12-3 [Apache Spark 3.0新功能] 新功能SQL建议语句 (10:35) 12-4 [Apache Spark 3.0新功能] Structured Streaming新功能 (07:37) 12-5 [Apache Spark 3.0新功能] Python API变更 (07:02) 12-6 [Apache Spark 3.0新功能] DataFrame和DataSet变更 (09:42) 12-7 [Apache Spark 3.0新功能] 大结局本书完 (11:19)





