能力缺口与课程目标
对于有Python基础但缺乏机器学习工程实践的开发者,这门课的核心缺口在于「从数学公式到工业级应用的转化能力」。多数学习者停留在调包阶段,对梯度下降的动态更新、正则化的几何意义、贝叶斯模型的参数推断等概念停留在符号层面。课程通过「自行车价格预测」等案例可视化参数迭代,用「金融风控」场景解析逻辑回归的损失函数推导,帮助学习者补齐「理论到代码」的缺失环节。尤其针对Scikit-learn的Pipeline工具,课程强调从数据预处理到模型评估的全链路管控,这是应届生简历中常见的能力短板。 课程解决的核心问题是:如何将抽象的数学模型(如神经网络反向传播的链式法则)转化为可重复的工程实践(如TensorFlow的自动微分机制)。通过分步拆解手写数字识别中的矩阵运算,学习者能理解Keras层的梯度传递逻辑,避免陷入「参数不收敛」却不知原因的死循环。资料包中的12个行业案例(含图像分类、智能推荐等)覆盖了模型选择、特征工程、超参调优的完整闭环,针对性弥补企业招聘时考察的「场景迁移能力」。配套练习设计:从理论推演到代码复现
练习系统包含3类梯度挑战:- 优化任务:给定鸢尾花数据集,用纯Python实现KNN的动态权重更新,对比原始排序算法的效率差异
- 可视化任务:通过Jupyter Notebook动态绘制L1/L2正则化对损失函数曲面的切割效果
- 工程任务:重构课程中的垃圾邮件识别项目,将朴素贝叶斯改为支持多分类的GBDT,并测量特征交叉次数的优化空间
适合基础与学习路径
本课程面向Python开发者,需满足以下前置条件:- 熟悉NumPy广播机制,能独立实现简单的矩阵乘法
- 了解决策树的递归分裂逻辑,如能写出ID3算法的伪代码
- 掌握Scikit-learn基础,如知道SVR与Logistic回归的差异
- 「线性模型」章节的L1/L2对比实验,可迁移到后续的CV/MNLP项目
- 「神经网络」部分的矩阵运算可视化,直接关联PyTorch/TensorFlow的梯度调试场景
- 「工业级Pipeline」模块,其参数化配置思路适用于所有含多步预处理的数据工程任务
学完能达到的独立能力
完成课程后,学习者能独立完成以下任务:- 针对电商推荐场景设计「协同过滤的损失函数优化」,并解释Embedding层的作用
- 构建金融风控的「反欺诈流水线」,包含特征筛选的自动交叉验证策略
- 用PyTorch实现动态ReLU门限调整的网络结构,解决图像分类中的梯度消失问题
资料包与工程化训练
资料包的核心组件包括:- 「可视化案例」代码库:用Plotly动态展示梯度下降的参数空间变化
- 「行业场景代码簿」:12个行业的模型调优参数对照表,含异常值处理模板
- 「企业级ML模板」:基于Docker的CI/CD流水线配置文件,支持模型版本控制
如何验证学习效果
有效性评估通过三个维度完成:- 「工程能力」测试:重构课程中的图像分类项目,要求在GPU环境下重建VGG16的TensorBoard监控面板
- 「数学理解」笔试:用5分钟解释图模型中边际概率的分解公式,并说明为何需要因子图
- 「问题解决」实战:给定医疗诊断数据集,需在1小时内设计「缺失值插补+异常值检测」的分层验证方案
课程介绍 一、课程定位 面向具备Python基础的开发者,通过”理论-推导-编码-优化”四阶闭环,培养解决实际问题的ML工程能力。课程特色包含: 数学可视化:如梯度下降算法通过自行车价格预测案例展示参数更新过程 工业级Pipeline构建:从数据清洗到模型部署的完整生命周期管理 多领域案例库:覆盖图像分类、金融风控、智能推荐等12个行业场景 二、核心模块设计 (1)数学模型推导篇 线性模型:通过房价预测案例推导最小二乘法,对比L1/L2正则化几何意义 概率图模型:基于垃圾邮件识别项目解析贝叶斯定理的工程化实现 神经网络:手写数字识别案例中演示反向传播的矩阵运算过程 (2)项目实战篇 # 示例:Scikit-learn工业流水线构建 from sklearn.pipeline import make_pipeline preprocessor = ColumnTransformer( transformers=[('num', StandardScaler(), numeric_features)] ) model = make_pipeline(preprocessor, RandomForestClassifier()) (代码体现特征工程与模型训练的耦合设计) 三、典型教学案例 电商用户分群:使用K-means++算法优化传统RFM模型 医疗影像分析:基于迁移学习的肺炎X光分类(准确率提升23%) 量化交易策略:LSTM预测股价波动性的过拟合控制方法 四、能力培养目标 维度 培养重点 评估方式 理论根基 矩阵微分/概率推断推导能力 数学证明作业 工程思维 特征工厂/AB测试设计 Kaggle竞赛排名 业务洞察 指标定义与商业价值映射 结业项目答辩 课程目录 /15-059-腾讯课堂-贪心学院-结合实际案例推导机器学习数学模型以及项目实战/ │├─第01节 机器学习介绍 │├─第02节 K-NN 最近邻 │├─第03节 线性回归与逻辑回归 │├─第04节 朴素贝叶斯 │├─第05节 SVM支持向量机 │├─第06节 决策树与随机森林 │├─第07节 K-means │├─第08节 矩阵分解 │├─第09节 Boosting │├─第10节 主题模型 详细目录 第01节 机器学习介绍/ │├─1.1机器学习、大数据、数据挖掘的区别和联系.mp4 38.6MB │├─1.2分类、回归和聚类的理论.mp4 33.7MB │├─1.3机器学习的流程 数据预处理.mp4 48.4MB │├─1.4案例:通过广告投放预测产品销量.mp4 247.6MB │├─机器学习课件及代码.zip 72.4MB 第02节 K-NN 最近邻/ │├─2.1KNN介绍.mp4 270.7MB │├─2.2欧式距离以及KNN实现.mp4 383.4MB │├─2.3KNN的决策边界.mp4 254.2MB │├─2.4通过交叉验证选择K.mp4 112.4MB │├─2.5特征缩放.mp4 26.5MB │├─2.6二手车估价案例.mp4 255.9MB │├─2.7KNN的延伸内容(Optional).mp4 160.4MB 第03节 线性回归与逻辑回归/ │├─QA.mp4 276.8MB │├─线性回归1.mp4 38.1MB │├─线性回归2.mp4 59.8MB │├─逻辑回归1.mp4 33.6MB │├─逻辑回归2.mp4 67.3MB 第04节 朴素贝叶斯/ │├─4.1朴素贝叶斯的核心思想.mp4 49.2MB │├─4.2垃圾邮件分类-01.mp4 234.3MB │├─4.3垃圾邮件分类-02.mp4 403.1MB │├─4.4手推一个完整的例子.mp4 399.4MB │├─4.5文本表示-01.mp4 101.2MB │├─4.6文本表示-02.mp4 275.5MB │├─4.7Extensions.mp4 60.8MB 第05节 SVM支持向量机/ │├─5.1SVM-01.mp4 649.4MB │├─5.2SVM-02.mp4 97.2MB │├─5.3SVM-03.mp4 253.4MB │├─5.4SVM-04.mp4 416.3MB 第06节 决策树与随机森林/ │├─6.1决策树01.mp4 416.1MB │├─6.2决策树02.mp4 518.4MB │├─6.3随机森林01.mp4 593.3MB │├─6.4随机森林02.mp4 421.2MB │├─6.5随机森林03.mp4 162.5MB 第07节 K-means/ │├─7.1聚类分析.mp4 86.1MB │├─7.2kmeans算法.mp4 145.7MB │├─7.3kmeans算法过程及特性.mp4 127.7MB │├─7.4kmeans的实现.mp4 248.9MB │├─7.5kmeans案例.mp4 366MB │├─7.6kmeans的目标函数.mp4 244.3MB │├─7.7K值如何选择.mp4 128.6MB │├─7.8其他聚类算法及问答.mp4 128.6MB 第08节 矩阵分解/ │├─8.1Recommender.mp4 255.7MB │├─8.2矩阵分解推荐系统.代码演示.1.mp4 23.4MB │├─8.3矩阵分解推荐系统.代码演示.2.mp4 570.2MB 第09节 Boosting/ │├─9.1XGBoost.mp4 170.3MB │├─9.2训练模型.mp4 237MB │├─9.3使用泰勒级数近似目标函数.mp4 422.3MB │├─9.4新的目标函数.mp4 292.9MB │├─9.5寻找最好的Split.mp4 365.1MB 第10节 主题模型/ │├─10.1主题模型.mp4 378.1MB │├─10.2MLEvsMAPvsBayesian.mp4 218.1MB │├─10.3从生成的角度来看LDA.mp4 252.3MB │├─10.4计算模型的参数.mp4 526.6MB






