从传统机器学习到分布式大数据,这门课补齐的最后一环是什么

很多初学者卡在“会调包不会工程”的尴尬境地:本地跑通 Titanic 数据集,一到公司面对 TB 级日志就束手无策。这门课程正是为解决这一核心能力缺口设计的。它不单纯讲解 Python 单机代码,而是将视角拉高到 Spark MLlib 和分布式计算层面。内容涵盖了从 AI 基础认知、有监督/无监督学习本质,到 Kaggle 竞赛实战,再到海量数据挖掘工具的全链路。对于希望从事后端开发或数据工程方向,且需要理解模型在生产环境如何落地的学习者来说,这是补强工程化思维的关键一环。

前置基础与核心突破点

建议先快速过一遍前两节关于 AI 就业前景、必备技能及常见流程的视频,建立宏观认知,然后直接切入“机器学习与大数据-Kaggle 竞赛实战”。这里以 Rossmann 药店销量预测为例,你会看到完整的工业界流程:自定义损失函数、目标变量分析、数据预处理、模型训练与评估。特别是 ROC 和 AUC 评估指标的部分,是面试和实战中区分模型优劣的核心知识点。

进阶部分必须攻克 Spark 算子与 MLlib 的内容。通过 WordCount 实战理解分布式进程与算子操作的本质区别,再结合网页分类竞赛数据,学习如何使用 SparkML 进行交叉验证和超参数搜索。这是单机机器学习向大数据机器学习过渡的桥梁,也是本课程最具含金量的部分。

学完能做什么及练习配合

完成本课程后,你将能够独立处理中等规模以上的结构化数据,使用 Spark 生态工具进行特征工程、模型训练及性能调优,并具备参加 Kaggle 类数据分析竞赛的基础能力。资料包中的代码压缩包是练习的唯一来源,请务必对照视频亲手敲代码,尤其是预处理和交叉验证部分,只看不动手永远无法形成肌肉记忆。

课程目录

0-资料密码:MTcrr18oGVEnPXmy
1-人工智能基础-快速入门
1:人工智能就业前景与薪资.mp4 33.79M
2:人工智能适合人群与必备技能.mp4 21.05M
3:人工智能时代.mp4 16.73M
4:人工智能在各领域的应用.mp4 41.84M
5:人工智能常见流程.mp4 36.39M
6:机器学习不同的学习方式.mp4 31.24M
7:深度学习比传统机器学习有优势.mp4 33.53M
8:有监督机器学习任务与本质.mp4 23.26M
9:无监督机器学习任务与本质.mp4 31.15M
10-机器学习与大数据-Kaggle竞赛实战
1:Rossmann药店销量预测_kaggle的介绍.mp4 12.99M
2:对数据字段的介绍_导包.mp4 8.64M
3:自定义损失函数.mp4 9.45M
4:对数据里面的目标变量sales的一个分析.mp4 16.92M
5:数据的预处理.mp4 44.18M
6:模型的训练_评估.mp4 23.63M
7:kaggle竞赛网站学习.mp4 53.21M
代码.rar 6.42M
10:评估指标ROC和AUC.mp4 20.71M
11:竞赛其他相关提交成绩排行榜.mp4 20.00M
12:数据导入.mp4 23.64M
13:MLlib对网页分类竞赛数据预处理.mp4 38.73M
14:MLlib对网页分类竞赛数据预处理_模型训练.mp4 28.05M
15:MLlib对网页分类竞赛模型训练_模型训练评估_搜索最佳超参数.mp4 25.54M
16:使用SparkML对网页分类竞赛数据预处理_模型训练_交叉验证调参_01.mp4 37.66M
17:使用SparkML对网页分类竞赛数据预处理_模型训练_交叉验证调参_02.mp4 36.03M
18:使用SparkML对网页分类竞赛数据预处理_模型训练_交叉验证调参_03.mp4 28.98M
19:使用SparkML对网页分类竞赛数据预处理_模型训练_交叉验证调参_04.mp4 30.52M
8:Kaggle网页分类竞赛介绍.mp4 11.18M
9:评估指标ROC和AUC.mp4 22.36M
代码.rar 8.81M
11-机器学习与大数据-海量数据挖掘工具
10:分布式计算所需进程.mp4 15.59M
11:两种算子操作本质区别.mp4 26.09M
12:Spark算子操作实战讲解_代码实战WordCount_01.mp4 31.68M
13:Spark算子操作实战讲解_代码实战WordCount_02.mp4 25.91M
14:Spark算子操作实战讲解_代码实战WordCount_03.mp4 20.20M
15:Spark算子操作实战讲解_代码实战WordCount_04.mp4 17.87M
1:Spark特性_01.mp4 25.09M
2:Spark特性_02.mp4 17.41M
3:Spark对比hadoop优势.mp4 12.39M
4:回顾hadoop讲解shuffle.mp4 19.98M
5:分布式计算框架Shuffle的原理_01.mp4 25.52M
6:分布式计算框架Shuffle的原理_02.mp4 25.75M
7:分布式计算框架Shuffle的原理_03.mp4 17.40M
8:Spark的RDD特性_01.mp4 19.36M
9:Spark的RDD特性_02.mp4 21.88M
代码.rar 383.20M
资料.rar 1.49M
16:Spark数据缓存机制.mp4 29.18M
17:Spark宽依赖和窄依赖_01.mp4 24.87M
18:Spark宽依赖和窄依赖_02.mp4 22.53M
19:Spark宽依赖和窄依赖_03.mp4 15.82M
20:Spark术语总结.mp4 40.15M
21:分布式文件系统Block块的大小配置.mp4 44.19M
22:Spark程序启动运行流程详解_01.mp4 19.60M
23:Spark程序启动运行流程详解_02.mp4 28.62M
24:Spark程序启动运行流程详解_03.mp4 19.89M
25:讲解构建稀疏和稠密向量_01.mp4 33.94M
26:讲解构建稀疏和稠密向量_01.mp4 36.25M
27:构建LabeledPoint.mp4 44.28M
28:介绍SparkMLlib模块中实现的算法和调用.mp4 35.00M
29:SparkMLlib对于逻辑回归算法的调用.mp4 49.31M
30:SparkMLlib调用逻辑回归_自定义阈值_1.mp4 52.45M
31:SparkMLlib调用逻辑回归_自定义阈值_2.mp4 47.12M
32:SparkMLlib调用逻辑回归_使用标准归一化_1.mp4 38.65M
33:SparkMLlib调用逻辑回归_使用标准归一化_2.mp4 65.63M
34:SparkMLlib调用逻辑回归_使用标准归一化_3.mp4 33.16M
35:SparkMLlib调用逻辑回归_使用标准归一化_4.mp4 43.62M
36:SparkMLlib调用KMeans聚类_调用决策树(1)_1.mp4 37.81M
37:SparkMLlib调用KMeans聚类_调用决策树(1)_2.mp4 47.16M
38:SparkMLlib调用KMeans聚类_调用决策树(1)_3.mp4 40.96M
39:使用逻辑回归和随机森林对股票Stock预测案例实战_1.mp4 43.44M
40:使用逻辑回归和随机森林对股票Stock预测案例实战_2.mp4 34.89M
41:使用逻辑回归和随机森林对股票Stock预测案例实战_3.mp4 34.73M
42:从数据转化到训练集的构建.mp4 63.44M
43:模型的训练以及评估和调超参_1.mp4 35.14M
44:模型的训练以及评估和调超参_2.mp4 32.22M