课程目录
1 Spark介绍 特点 核心组件 (26:22) 2 Spark安装启动 本地模式 读取文件测试 (40:54) 3 Spark-shell中执行WordCount操作 (32:51) 4 spark提交样例程序 (32:50) 5 spark集群模式部署启动 (12:55) 6 6.spark集群中执行任务 配置启动查看历史服务 (24:05) 7 7.spark集群高可用配置 (15:01) 8 8.在IDEA中使用scala开发WordCount (30:30) 9 9.上节内容回顾 (11:08) 10 10.RDD的介绍及特点 (28:24) 11 11.RDD的创建方式 (26:54) 12 12.RDD中的算子map、flatMap、reduceByKey (28:10) 13 13.上午知识回顾 (07:52) 14 14.统计独立ip访问次数案例 (29:33) 15 15.由案例引出的问题及解决方案 (10:57) 16 16.RDD的特点 (12:17) 17 17.Transformation类型的算子1 (31:41) 18 18.Transformation类型的算子2 (44:35) 19 19.上节内容回顾 (12:41) 20 20.Transformation类型的算子3 (30:51) 21 21.Transformation类型的算子4 (39:33) 22 22.Action类型的算子 (36:41) 23 23.Spark RDD练习:PM值统计案例 (35:57) 24 24.RDD查看分区 指定分区 (38:12) 25 25.缓存的意义 (43:03) 26 26.缓存API使用 缓存级别 (25:08) 27 27.checkpoint的作用及使用 (20:19) 28 28.上节内容回顾 (09:24) 29 29.搜狗搜索日志案例:读取数据 (35:36) 30 30.搜狗搜索日志案例:搜索关键词统计 (38:40) 31 31.搜狗搜索日志案例:用户搜索词点击统计 (17:40) 32 32.向Hbase中写数据:处理数据 创建表 (46:15) 33 33.向HBase中写数据:组装数据 写入表 (31:36) 34 34.从HBase中读取数据 (34:01) 35 35.向Mysql中插入词频统计结果 (36:13) 36 36.共享变量:广播变量 累加器 (46:24) 37 37.Spark宽依赖 窄依赖 内核调度 (45:26) 38 38.SparkSQL是什么 适用场景 (27:33) 39 39.SparkSQL命令式API SparkSession (44:32) 40 40.SparkSQL声明式API (20:04) 41 41.Catalyst优化器 (28:11) 42 42.Dataset的特点 (50:50) 43 43.DataFrame是什么 如何创建 (25:24) 44 44.DataFrame支持什么操作 (35:07) 45 45.Dataset和DataFrame的区别 Row对象 (42:10) 46 46.初识 DataFrameReader (23:00) 47 47.初识 DataFrameWriter (12:47) 48 48.读写Parquet格式数据 (16:19) 49 49.分区读写 Parquet 格式文件 (23:39) 50 50.读写JSON格式数据 (20:55) 51 51.SparkSQL访问Hive数据 (59:08) 52 52.SparkSQL向Hive中保存数据 (39:46) 53 53.上节内容回顾 (08:56) 54 54.SparkSQL向MySQL中写入数据 (25:35) 55 55.有类型的转换操作1 (50:09) 56 56.有类型的转换操作2 (31:44) 57 57.无类型的转换操作 (34:30) 58 58.Column对象的创建 (24:15) 59 59.Column对象的相关操作 (17:15) 60 60.缺失值处理 特殊类型NaN null (34:44) 61 61.字符串缺失值处理 (29:33) 62 62.聚合操作 groupBy (27:22) 63 63.groupBy多维聚合 (28:04) 64 64.多维聚合 rollup cube (44:13) 65 65.连接操作 交叉连接 内连接 (38:24) 66 66.其他连接方式 (20:00) 67 67.functions.UDF (22:24) 68 68.上节知识回顾 (09:07) 69 69.窗口函数 案例1 (38:46) 70 70.窗口函数 案例2 (11:52) 71 71.出租车项目 业务分析 数据读取 (30:11) 72 72.出租车项目 数据清洗、转换 (01:10:10) 73 73.出租车项目 EitherTest (38:14) 74 74.出租车项目 使用Either处理异常 (32:05) 75 75.出租车项目 查看数据分布,剪除反常数据 (26:46) 76 76.Json4s转换测试 (53:43) 77 77.GeoJSON文件转为对象 类型分装 转换 (40:27) 78 78.针对行政区排序 根据经纬度查找行政区信息 (48:52) 79 79.统计行政区信息 (13:45) 80 80.统计行政区平均待客时长 (50:52) 81 81.SparkStreaming介绍 (23:14) 82 82.Socket netcat工具 (12:55) 83 83.SparkStreaming入门案例 (43:31) 84 84.上午知识回顾 (08:04) 85 85.SparkStreaming原理 (33:55) 86 86.SparkStreaming容错方案 (06:22) 87 87.SparkStreaming全局词频统计 (34:20) 88 88.SparkStreaming中的窗口操作 (19:17) 89 89.编程模型进化 SparkStreaming 和 StructuredStreaming (37:19) 90 90.StructuredStreaming入门案例 (29:49) 91 91.StructuredStreaming体系结构 (38:45) 92 92.StructuredStreaming读取HDFS数据 (38:55) 93 93.StructuredStreaming读取Kafka数据 (01:46:32) 94 94.写数据到HDFS (43:07) 95 95.写入数据到Kafka (34:15) 96 96.Foreach Sink写入数据到MySQL (27:40) 97 97.错误恢复和容错语义 (43:47)





