从理论懂到能调优,中间隔着什么?
很多学习者卡在这样一个阶段:决策树、随机森林的原理背得滚瓜烂熟,也能手写 GBDT 的推导过程,但一上手做风控模型,面对几百万行的训练数据就发了怵。不是不懂算法,而是不知道怎么把算法“装”进工程里,尤其是当传统梯度提升树(GBDT)开始显得吃力时,该选 XGBoost 还是 LightGBM?
这门课专门解决这个“最后一公里”的能力缺口。它不重复讲基础的分类回归概念,而是直接切入当下风控和数据挖掘领域最主流的两大增量编码树算法。你会明白 XGBoost 的泰勒展开二阶导优化策略究竟带来了什么优势,以及 LightGBM 的直方图算法和单边梯度采样是如何在保持精度的同时大幅压缩训练时间的。这些细节决定了你在处理高维稀疏数据时的效率选择。
特征工程与超参调优的实战闭环
算法选型只是第一步,更关键的痛点在于:模型效果不好时,是该换算法还是该修特征?课程的第二部分重点突破这两个盲区。在特征选择环节,你会学到如何从众多变量中剔除无效噪音,避免过拟合,这是风控模型稳定性的基石。而在超参数调优板块,课程会带你从零搭建一套完整的模型训练工作流,包括前期的数据清洗规范、算法包的调用技巧,以及网格搜索或随机搜索在真实场景中的落地策略。
这里没有抽象的理论堆砌,而是通过完整的案例串联起从数据准备到模型输出的全过程。你将学会如何解读训练日志,如何判断模型是处于高偏差还是高方差状态,并针对性地调整正则化项或学习率。这种端到端的训练经验,是区分“懂算法”和“能开发”的分水岭。
学完能独立做什么?
- 能够根据数据规模和维度特征,合理选型 XGBoost 或 LightGBM,并解释其底层优化差异。
- 掌握特征重要性评估方法,能独立构建有效的特征筛选 pipeline。
- 具备独立完成风控模型超参数调优的能力,理解训练过程中的关键指标含义。
建议学习时配合资料包中的案例代码进行复现。不要只看视频演示,务必亲手跑通数据预处理和模型训练的代码,特别是观察不同参数变化对 AUC 或 KS 值的影响,这样才能真正将知识转化为可调用的工程能力。
课程目录
1-1 [算法精进:XGBoost, LightGBM等算法和特征选择] 决策树模型 (09:16) 1-2 [算法精进:XGBoost, LightGBM等算法和特征选择] 随机森林算法与GBDT算法 (09:20) 1-3 [算法精进:XGBoost, LightGBM等算法和特征选择] XGBoost算法 (05:33) 1-4 [算法精进:XGBoost, LightGBM等算法和特征选择] LightGBM算法 (12:39) 1-5 [算法精进:XGBoost, LightGBM等算法和特征选择] 特征选择算法 (06:40) 2-1 [模型开发:超参调优与模型训练案例] 超参数调优 (08:55) 2-2 [模型开发:超参调优与模型训练案例] 模型训练和超参调优案例:前期数据准备与算法包介绍 (08:50) 2-3 [模型开发:超参调优与模型训练案例] 模型训练和超参调优案例:超参调优 (07:23) 2-4 [模型开发:超参调优与模型训练案例] 模型训练和超参调优案例:特征选择 (05:32) 3-1 [技能补充:拒绝推断方法] 风险建模样本特点和几类模型 (03:03) 3-2 [技能补充:拒绝推断方法] 拒绝推断算法 (11:01) 4-1 [应用实践:风控算法应用综合案例] 数据准备 (08:54) 4-2 [应用实践:风控算法应用综合案例] eda分析与样本集定义 (05:58) 4-3 [应用实践:风控算法应用综合案例] 特征处理和选择 (06:20) 4-4 [应用实践:风控算法应用综合案例] 构建模型 (06:20) 4-5 [应用实践:风控算法应用综合案例] 模型效果评估 (07:44)





