厘清微调边界,补齐强化学习短板

很多开发者对大模型微调的理解停留在“跑通代码”层面,但缺乏对底层原理的深层认知,导致在选型时容易盲目,在优化时缺乏依据。这门课直击这一痛点,首先深入剖析预训练中的数据并行、模型并行及3D并行机制,明确区分全量微调与高效微调的适用场景。更关键的是,它系统梳理了LoRA、PPO、RLHF、DPO、GRPO等强化学习范式,帮你理解不同算法在奖励模型构建和策略优化上的差异。如果你只能写出微调脚本,却说不清为什么选LoRA而不是QLoRA,或者不懂DPO相比PPO在数据需求上的优势,那么第一、二章的理论剖析就是必须补的基础。建议先花大量时间理解这些概念背后的数学逻辑和工程权衡,这决定了你后续技术选型的上限。

金融场景下的SFT全流程实战

理论落地需要具体的项目支撑,课程后半部分聚焦于企业级金融大模型的SFT(监督微调)方案设计与落地。这里没有泛泛而谈的通用Demo,而是针对金融领域数据特点,演示了从数据集构建策略、基座模型下载,到LoRA参数配置、数据处理、模型加载的完整链路。重点在于微调过程中的监控与评估:课程详细讲解了如何分析learning_rate、train_loss、eval_loss等核心指标,利用TensorBoard进行可视化监控,并设置早停机制和内存优化回调函数。学完这部分,你不仅能完成微调,更能通过指标波动判断模型是否过拟合或欠拟合,知道何时该停止训练,以及如何评估微调后的效果是否真正优于基座模型。这种对“黑盒”训练过程的白盒化掌控能力,是迈向企业级开发的关键分水岭。

配套资料与能力验收标准

资料包中的文档和说明文件主要辅助理解原理章节和项目设计思路,建议配合视频观看,重点标记那些涉及参数配置阈值的部分。学完本课程,你应当能独立回答以下问题:在显存受限情况下,如何科学选择量化位宽和LoRA秩参数?当RLHF中的奖励模型评分与人工直觉不一致时,该如何排查数据噪声?在金融敏感场景下,如何构建合规且高质量的双语微调数据集?不要仅满足于跑通代码,要尝试复现课程中的监控图表,理解每个指标变化的物理意义。真正的掌握标志,是你面对新的微调需求时,能基于原理快速制定技术方案,并通过指标监控精准定位问题,而非依赖试错法。

课程目录

📁 第1章 模型高效微调原理剖析
第1章 模型高效微调原理剖析文档.png [493.5 KB]
1-8 高效微调原理之预训练之数据并行.mp4 [26.7 MB]
1-3 高效微调原理之什么场景需要RAG?.mp4 [20.3 MB]
1-7 高效微调原理之预训练之网络通信.mp4 [18.3 MB]
1-6 高效微调原理之预训练的两个挑战.mp4 [25.2 MB]
1-10 高效微调原理之预训练之3D并行.mp4 [21.5 MB]
1-12 高效微调原理之LoRA原理.mp4 [94.1 MB]
1-9 高效微调原理之预训练之模型并行.mp4 [23.2 MB]
1-5 高效微调原理之预训练的流程.mp4 [39.2 MB]
1-11 高效微调原理之微调步骤.mp4 [28.4 MB]
1-1 课程介绍.mp4 [22.7 MB]
1-2 高效微调原理之什么场景需要微调?.mp4 [26.3 MB]
1-4 高效微调原理之微调和全量微调的区别.mp4 [32.8 MB]
📁 第2章 大模型强化学习原理剖析
第2章 大模型强化学习原理剖析必看.zip [1.8 MB]
2-2 强化学习微调之什么是PPO?.mp4 [20.8 MB]
2-3 强化学习微调之什么是RLHF?.mp4 [11.5 MB]
2-1 强化学习微调之什么是强化学习?.mp4 [35.7 MB]
2-4 强化学习微调之什么是DPO?.mp4 [26.6 MB]
2-5 强化学习微调之什么是GRPO?.mp4 [22.3 MB]
📁 第7章 企业金融大模型微调项目—SFT 方案设计与落地
第7章 企业金融大模型微调项目—SFT 方案设计与落地说明.zip [1.8 MB]
7-9 SFT 微调之数据集构建 - 数据构建策略.mp4 [19.4 MB]
7-22 SFT微调之LoRa微调-模型评估内存优化回调函数.mp4 [14.6 MB]
7-37 SFT微调之LoRa微调-微调效果评估之SFT模型部署.mp4 [45.4 MB]
7-7 SFT 微调之微调方案选型.mp4 [36.8 MB]
7-21 SFT微调之LoRa微调-基础模型加载.mp4 [39.0 MB]
7-17 SFT微调之LoRa微调-数据处理.mp4 [33.9 MB]
7-25 SFT微调之LoRa微调-模型微调的早停机制.mp4 [13.5 MB]
7-31 SFT微调之LoRa微调-核心监控指标之learning_rate分析.mp4 [29.0 MB]
7-5 SFT 微调之数据集选择.mp4 [29.2 MB]
7-12 SFT 微调之 LoRa 微调 - 微调技术方案选型.mp4 [50.3 MB]
7-29 SFT微调之LoRa微调-核心监控指标之train_loss分析.mp4 [56.7 MB]
7-30 SFT微调之LoRa微调-核心监控指标之eval_loss分析.mp4 [17.3 MB]
7-15 SFT微调之LoRa微调-微调基座模型下载.mp4 [16.0 MB]
7-36 SFT微调之LoRa微调-微调效果评估之评估效果说明.mp4 [18.1 MB]
7-18 SFT微调之LoRa微调-LoRA参数配置.mp4 [49.5 MB]
7-28 SFT微调之LoRa微调-TensorBoard可视化监控.mp4 [33.9 MB]
7-1 整体项目之项目背景.mp4 [30.6 MB]
7-35 SFT微调之LoRa微调-微调效果评估之Perplexity指标.mp4 [11.6 MB]
7-8 SFT 微调之数据集构建 - 数据集解析.mp4 [60.1 MB]
7-32 SFT微调之LoRa微调-核心监控指标之grad_norm分析.mp4 [27.4 MB]
7-3 整体项目之技术方案.mp4 [15.5 MB]
7-34 SFT微调之LoRa微调-微调效果评估之ROUGE指标.mp4 [25.2 MB]
7-23 SFT微调之LoRa微调-最佳模型保存函数.mp4 [30.3 MB]
7-4 SFT 微调之微调技术流程.mp4 [13.9 MB]
7-26 SFT微调之LoRa微调-微调的checkpoints机制设置.mp4 [8.6 MB]
7-11 SFT 微调之数据集构建 - 多轮数据集构建.mp4 [40.1 MB]
7-20 SFT微调之LoRa微调-创建数据整理器.mp4 [19.6 MB]
7-33 SFT微调之LoRa微调-多轮对话微调数据处理.mp4 [43.9 MB]
7-24 SFT微调之LoRa微调-最后模型保存函数.mp4 [25.1 MB]
7-6 SFT 微调之模型选型.mp4 [31.7 MB]
7-10 SFT 微调之数据集构建 - 单轮数据集构建.mp4 [60.6 MB]
7-19 SFT微调之LoRa微调-SFT微调参数配置.mp4 [44.4 MB]
7-2 整体项目之项目需求.mp4 [14.6 MB]
7-14 SFT微调之LoRa微调-微调环境构建.mp4 [21.4 MB]
7-13 SFT微调之LoRa微调-微调技术方案设计思考.mp4 [57.9 MB]
7-16 SFT微调之LoRa微调-数据样本初始化.mp4 [43.5 MB]
📁 第9章 企业金融大模型微调项目—GRPO 方案设计与落地
第9章 企业金融大模型微调项目—GRPO 方案设计与落地必看.png [493.5 KB]
📁 第4章 Llama-Factory 微调实战
第4章 Llama-Factory 微调实战文档.zip [1.8 MB]
4-3 Llama-Factory微调之模型和数据准备.mp4 [62.1 MB]
4-10 Text2SQL模型微调之数据处理.mp4 [41.9 MB]
4-4 Llama-Factory微调之LoRa微调实战.mp4 [37.2 MB]
4-9 Text2SQL模型微调之数据集准备.mp4 [22.4 MB]
4-8 Text2SQL模型微调之数据集格式说明.mp4 [25.8 MB]
4-12 Text2SQL模型微调之微调实战.mp4 [16.6 MB]
4-15 Text2SQL模型微调之基于DeepSpeed实战.mp4 [43.6 MB]
4-5 Llama-Factory微调之模型效果验证.mp4 [14.1 MB]
4-11 Text2SQL模型微调之数据集注册.mp4 [20.4 MB]
📁 第5章 微调医疗场景 Embedding 模型
第5章 微调医疗场景 Embedding 模型文档.zip [1.8 MB]
5-3 Embedding模型微调之基础模型选型.mp4 [16.3 MB]
5-5 Embedding模型微调之技术方案选型.mp4 [68.2 MB]
5-11 Embedding模型微调之微调数据准备核心逻辑.mp4 [66.8 MB]
5-12 Embedding模型微调之微调核心代码.mp4 [32.5 MB]
5-7 Embedding模型微调之基础模型校验.mp4 [20.3 MB]
5-6 Embedding模型微调之环境准备.mp4 [57.6 MB]
5-4 Embedding模型微调之数据集准备.mp4 [42.2 MB]
5-2 Embedding模型微调之适用场景剖析.mp4 [17.5 MB]
5-13 Embedding模型微调之微调效果检验.mp4 [25.3 MB]
5-9 Embedding模型微调之数据集清洗.mp4 [15.7 MB]
5-8 Embedding模型微调之数据集校验.mp4 [32.0 MB]
📁 第3章 大模型训练数据工程
第3章 大模型训练数据工程资料.png [493.5 KB]
3-2 大模型微调数据格式划分.mp4 [31.3 MB]
3-10 大模型微调数据集构建实操-构建SFT数据集.mp4 [30.1 MB]
3-4 大模型微调SFT数据集.mp4 [20.5 MB]
3-11 大模型微调数据集构建实操-构建偏好数据集.mp4 [17.7 MB]
3-3 大模型微调预训练数据集.mp4 [33.7 MB]
3-7 大模型微调数据集生成实战.mp4 [27.1 MB]
3-5 大模型微调偏好数据集.mp4 [13.7 MB]
3-8 大模型微调数据集工具部署.mp4 [20.7 MB]
3-1 大模型微调数据的重要性.mp4 [35.8 MB]
3-6 大模型微调COT数据集.mp4 [40.3 MB]
3-9 大模型微调数据集构建实操-构建COT数据集.mp4 [20.3 MB]
📁 第8章 企业金融大模型微调项目—奖励模型方案设计与落地
第8章 企业金融大模型微调项目—奖励模型方案设计与落地必看.png [493.5 KB]
8-5 奖励模型之微调数据集构建方案思考.mp4 [52.1 MB]
8-10 奖励模型之奖励模型选型.mp4 [73.3 MB]
8-6 奖励模型之微调数据集构建策略.mp4 [45.6 MB]
8-8 奖励模型之奖励模型训练路径分析.mp4 [28.3 MB]
8-9 奖励模型之基于RewardBench排行榜选型.mp4 [33.5 MB]
8-2 奖励模型之为什么选GRPO?.mp4 [29.8 MB]
8-1 奖励模型之需求背景分.mp4 [13.2 MB]
8-4 奖励模型之整体流程设计.mp4 [14.1 MB]
8-7 奖励模型之微调数据集构建脚本执行.mp4 [39.2 MB]
8-3 奖励模型之为什么GRPO必须微调奖励模型?.mp4 [31.0 MB]
📁 第6章 蒸馏专属大模型
第6章 蒸馏专属大模型说明.zip [1.8 MB]
6-1 模型蒸馏之蒸馏和微调的本质区别.mp4 [40.6 MB]
6-5 模型蒸馏之蒸馏流程剖析.mp4 [20.7 MB]
6-7 模型蒸馏之资源评估和服务器租赁.mp4 [23.2 MB]
6-14 模型蒸馏之模型蒸馏前后效果对比.mp4 [13.2 MB]
6-4 模型蒸馏之模型推理能力的重要性.mp4 [13.1 MB]
6-10 模型蒸馏之蒸馏数据格式说明.mp4 [21.6 MB]
6-12 模型蒸馏之蒸馏数据集准备.mp4 [65.4 MB]
6-13 模型蒸馏之基于Llama-Factory进行全量微调.mp4 [92.2 MB]
6-3 模型蒸馏之为什么蒸馏方案突然火了起来?.mp4 [32.4 MB]
6-6 模型蒸馏之全量微调工具推荐.mp4 [20.1 MB]
6-2 模型蒸馏之微调和全量微调的本质区别.mp4 [33.8 MB]
6-9 模型蒸馏之全量微调工具安装部署.mp4 [32.1 MB]
6-8 模型蒸馏之基础模型下载.mp4 [28.3 MB]
6-11 模型蒸馏之基础模型效果测试.mp4 [14.6 MB]