这门课解决什么问题

这门课程主要解决初学者和转岗者在学习 Apache Spark 时遇到的问题,特别是使用 Java 语言进行编程。课程详细介绍了 Spark 的基础概念、部署方式、数据结构及 RDD(弹性分布式数据集)的操作方法,帮助学员从零开始掌握 Spark 的核心原理和实践应用。

适合什么基础

适合有一定 Java 编程基础但对大数据处理和 Spark 不熟悉的开发者。课程从 Spark 的基本概念到具体编程实践,逐步深入,适合那些想要转行进入大数据处理领域或者希望提升现有技能的开发者。

建议先看哪几块

建议先观看以下几块内容:
  • 001.Spark-教程简介

  • 002.Spark-文件结构-介绍

  • 003.Spark-基础概念-介绍-分布式

  • 004.Spark-基础概念-介绍-计算

  • 008.Spark-介绍

这些内容将帮助你快速了解 Spark 的基础知识和结构,为后续学习打下坚实的基础。

学完能独立做什么

学完这门课程后,你将能够独立完成以下任务:
  • 搭建 Spark 的部署环境,包括本地模式和 Yarn 模式。

  • 使用 Java 编程语言开发简单的 Spark 应用程序,包括数据处理和分析。

  • 理解和应用 RDD 的基本操作,如 map、filter 和 reduce 等。

你可以通过这些技能参与到数据分析项目中,进行数据的清洗、处理和分析工作。

资料怎么配合练习

资料包中的代码和示例文件将帮助你更好地理解和掌握课程内容。建议按照以下步骤进行练习:
  • 先阅读课程讲解,理解每个概念和操作的原理。

  • 然后观看相关的代码示例,跟随实际代码进行实践。

  • 最后,尝试自己编写代码解决实际问题,不断巩固所学知识。

通过这些步骤,你不仅能够掌握 Spark 的核心概念和技术,还能提升实际编程能力,为未来的职业发展打下坚实的基础。

课程目录

001.Spark-教程简介
002.Spark-文件结构-介绍
003.Spark-基础概念-介绍-分布式
004.Spark-基础概念-介绍-计算
005.Spark-基础概念-介绍-分布式基础架构
006.Spark-基础概念-介绍-框架
007.Spark-基础概念-介绍-Spark和MR的关系
008.Spark-介绍
009.Spark-部署方式-介绍
010.Spark-解压后的文件结构
011.Spark-部署环境-Local
012.Spark-部署环境-Local-演示
013.Spark-部署环境-Yarn-演示
014.Spark-部署环境-Yarn-历史服务
015.Spark-部署环境-Yarn-两种执行方式Cluster和Client
016.Spark-部署环境-几种模式的对比
017.Spark-数据结构-说明
018.Spark-RDD-介绍
019.Spark-RDD-数据处理流程简介
020.Spark-RDD-计算原理
021.Spark-RDD-计算原理-补充
022.Spark-RDD-代码-环境的准备
023.Spark-RDD-代码-对接内存数据源构建RDD对象
024.Spark-RDD-代码-对接磁盘数据源构建RDD对象
025.Spark-RDD-代码-RDD的理解
026.Spark-RDD-代码-RDD的分区
027.Spark-RDD-代码-内存数据源-分区数量的设定
028.Spark-RDD-代码-磁盘文件数据源-分区数量的设定
029.Spark-RDD-代码-内存数据源-分区数据的分配
030.Spark-RDD-代码-磁盘文件数据源-分区数据的分配
031.Spark-RDD-代码-磁盘文件数据源-分区数据的分配-演示
033.Spark-RDD-方法-介绍
034.Spark-RDD-方法-方法的两大类-转换和行动
035.Spark-RDD-方法-数据处理的两大类-单值和键值
036.Spark-RDD-方法-转换-map
037.Spark-RDD-方法-转换-map-1
038.Spark-RDD-方法-转换-map-2
039.Spark-RDD-方法-转换-map-3
040.Spark-RDD-方法-转换-map-4
041.Spark-RDD-方法-转换-filter
042.Spark-RDD-方法-转换-flatMap
043.Spark-RDD-方法-转换-flatMap-1
044.Spark-RDD-方法-转换-groupBy
045.Spark-RDD-回顾-原理
046.Spark-RDD-回顾-方法
047.Spark-RDD-Shuffle
048.Spark-RDD-Shuffle-原理
049.Spark-RDD-Shuffle-原理-补充
050.Spark-RDD-Shuffle-演示
051.Spark-RDD-方法-distinct
052.Spark-RDD-方法-sortBy
053.Spark-RDD-方法-KV类型数据介绍
054.Spark-RDD-方法-KV类型数据补充
055.Spark-RDD-方法-KV-mapValues
056.Spark-RDD-方法-KV-wordCount
057.Spark-RDD-方法-KV-groupByKey
058.Spark-RDD-方法-KV-reduceByKey
059.Spark-RDD-方法-KV-sortByKey
060.Spark-RDD-方法-KV-reduceByKey和groupByKey的区别
061.Spark-RDD-WordCount程序在环境中运行
062.Spark-RDD-转换方法的回顾
063.Spark-RDD-行动算子-介绍
064.Spark-RDD-行动算子-collect
065.Spark-RDD-行动算子-collect-补充
066.Spark-RDD-行动算子-其他方法-1
067.Spark-RDD-行动算子-其他方法-2
068.Spark-RDD-行动算子-其他方法-3
069.Spark-RDD-行动算子-Driver端和Executor端数据传输
070.Spark-RDD-序列化-1
071.Spark-RDD-序列化-2
072.Spark-案例-数据格式说明
073.Spark-案例-需求介绍
074.Spark-案例-需求分析
075.Spark-案例-需求设计
076.Spark-案例-开发原则
077.Spark-案例-代码实现-1
078.Spark-案例-代码实现-2
079.Spark-案例-代码实现-3
080.Spark-案例-代码实现-4
081.Spark-RDD-KRYO序列化框架