从传统机器学习到分布式大数据,这门课补齐的最后一环是什么
很多初学者卡在“会调包不会工程”的尴尬境地:本地跑通 Titanic 数据集,一到公司面对 TB 级日志就束手无策。这门课程正是为解决这一核心能力缺口设计的。它不单纯讲解 Python 单机代码,而是将视角拉高到 Spark MLlib 和分布式计算层面。内容涵盖了从 AI 基础认知、有监督/无监督学习本质,到 Kaggle 竞赛实战,再到海量数据挖掘工具的全链路。对于希望从事后端开发或数据工程方向,且需要理解模型在生产环境如何落地的学习者来说,这是补强工程化思维的关键一环。
前置基础与核心突破点
建议先快速过一遍前两节关于 AI 就业前景、必备技能及常见流程的视频,建立宏观认知,然后直接切入“机器学习与大数据-Kaggle 竞赛实战”。这里以 Rossmann 药店销量预测为例,你会看到完整的工业界流程:自定义损失函数、目标变量分析、数据预处理、模型训练与评估。特别是 ROC 和 AUC 评估指标的部分,是面试和实战中区分模型优劣的核心知识点。
进阶部分必须攻克 Spark 算子与 MLlib 的内容。通过 WordCount 实战理解分布式进程与算子操作的本质区别,再结合网页分类竞赛数据,学习如何使用 SparkML 进行交叉验证和超参数搜索。这是单机机器学习向大数据机器学习过渡的桥梁,也是本课程最具含金量的部分。
学完能做什么及练习配合
完成本课程后,你将能够独立处理中等规模以上的结构化数据,使用 Spark 生态工具进行特征工程、模型训练及性能调优,并具备参加 Kaggle 类数据分析竞赛的基础能力。资料包中的代码压缩包是练习的唯一来源,请务必对照视频亲手敲代码,尤其是预处理和交叉验证部分,只看不动手永远无法形成肌肉记忆。
课程目录
0-资料密码:MTcrr18oGVEnPXmy 1-人工智能基础-快速入门 1:人工智能就业前景与薪资.mp4 33.79M 2:人工智能适合人群与必备技能.mp4 21.05M 3:人工智能时代.mp4 16.73M 4:人工智能在各领域的应用.mp4 41.84M 5:人工智能常见流程.mp4 36.39M 6:机器学习不同的学习方式.mp4 31.24M 7:深度学习比传统机器学习有优势.mp4 33.53M 8:有监督机器学习任务与本质.mp4 23.26M 9:无监督机器学习任务与本质.mp4 31.15M 10-机器学习与大数据-Kaggle竞赛实战 1:Rossmann药店销量预测_kaggle的介绍.mp4 12.99M 2:对数据字段的介绍_导包.mp4 8.64M 3:自定义损失函数.mp4 9.45M 4:对数据里面的目标变量sales的一个分析.mp4 16.92M 5:数据的预处理.mp4 44.18M 6:模型的训练_评估.mp4 23.63M 7:kaggle竞赛网站学习.mp4 53.21M 代码.rar 6.42M 10:评估指标ROC和AUC.mp4 20.71M 11:竞赛其他相关提交成绩排行榜.mp4 20.00M 12:数据导入.mp4 23.64M 13:MLlib对网页分类竞赛数据预处理.mp4 38.73M 14:MLlib对网页分类竞赛数据预处理_模型训练.mp4 28.05M 15:MLlib对网页分类竞赛模型训练_模型训练评估_搜索最佳超参数.mp4 25.54M 16:使用SparkML对网页分类竞赛数据预处理_模型训练_交叉验证调参_01.mp4 37.66M 17:使用SparkML对网页分类竞赛数据预处理_模型训练_交叉验证调参_02.mp4 36.03M 18:使用SparkML对网页分类竞赛数据预处理_模型训练_交叉验证调参_03.mp4 28.98M 19:使用SparkML对网页分类竞赛数据预处理_模型训练_交叉验证调参_04.mp4 30.52M 8:Kaggle网页分类竞赛介绍.mp4 11.18M 9:评估指标ROC和AUC.mp4 22.36M 代码.rar 8.81M 11-机器学习与大数据-海量数据挖掘工具 10:分布式计算所需进程.mp4 15.59M 11:两种算子操作本质区别.mp4 26.09M 12:Spark算子操作实战讲解_代码实战WordCount_01.mp4 31.68M 13:Spark算子操作实战讲解_代码实战WordCount_02.mp4 25.91M 14:Spark算子操作实战讲解_代码实战WordCount_03.mp4 20.20M 15:Spark算子操作实战讲解_代码实战WordCount_04.mp4 17.87M 1:Spark特性_01.mp4 25.09M 2:Spark特性_02.mp4 17.41M 3:Spark对比hadoop优势.mp4 12.39M 4:回顾hadoop讲解shuffle.mp4 19.98M 5:分布式计算框架Shuffle的原理_01.mp4 25.52M 6:分布式计算框架Shuffle的原理_02.mp4 25.75M 7:分布式计算框架Shuffle的原理_03.mp4 17.40M 8:Spark的RDD特性_01.mp4 19.36M 9:Spark的RDD特性_02.mp4 21.88M 代码.rar 383.20M 资料.rar 1.49M 16:Spark数据缓存机制.mp4 29.18M 17:Spark宽依赖和窄依赖_01.mp4 24.87M 18:Spark宽依赖和窄依赖_02.mp4 22.53M 19:Spark宽依赖和窄依赖_03.mp4 15.82M 20:Spark术语总结.mp4 40.15M 21:分布式文件系统Block块的大小配置.mp4 44.19M 22:Spark程序启动运行流程详解_01.mp4 19.60M 23:Spark程序启动运行流程详解_02.mp4 28.62M 24:Spark程序启动运行流程详解_03.mp4 19.89M 25:讲解构建稀疏和稠密向量_01.mp4 33.94M 26:讲解构建稀疏和稠密向量_01.mp4 36.25M 27:构建LabeledPoint.mp4 44.28M 28:介绍SparkMLlib模块中实现的算法和调用.mp4 35.00M 29:SparkMLlib对于逻辑回归算法的调用.mp4 49.31M 30:SparkMLlib调用逻辑回归_自定义阈值_1.mp4 52.45M 31:SparkMLlib调用逻辑回归_自定义阈值_2.mp4 47.12M 32:SparkMLlib调用逻辑回归_使用标准归一化_1.mp4 38.65M 33:SparkMLlib调用逻辑回归_使用标准归一化_2.mp4 65.63M 34:SparkMLlib调用逻辑回归_使用标准归一化_3.mp4 33.16M 35:SparkMLlib调用逻辑回归_使用标准归一化_4.mp4 43.62M 36:SparkMLlib调用KMeans聚类_调用决策树(1)_1.mp4 37.81M 37:SparkMLlib调用KMeans聚类_调用决策树(1)_2.mp4 47.16M 38:SparkMLlib调用KMeans聚类_调用决策树(1)_3.mp4 40.96M 39:使用逻辑回归和随机森林对股票Stock预测案例实战_1.mp4 43.44M 40:使用逻辑回归和随机森林对股票Stock预测案例实战_2.mp4 34.89M 41:使用逻辑回归和随机森林对股票Stock预测案例实战_3.mp4 34.73M 42:从数据转化到训练集的构建.mp4 63.44M 43:模型的训练以及评估和调超参_1.mp4 35.14M 44:模型的训练以及评估和调超参_2.mp4 32.22M





![大疆维修,无人机维修教程[66.30GB]](/_next/image?url=https%3A%2F%2Fwww.itzhibei.com%2Fapi%2Fuploads%2Fb6a69810-862f-479c-a529-d66880073ebc.jpg&w=1920&q=75)