课程定位:补齐“只会调用API”的能力缺口
目前市场上大部分AI应用开发者卡在“只会调接口”的阶段,一旦涉及私有数据、成本可控性或垂直领域效果优化,便无从下手。本课程直指这一痛点,系统讲解从0到1训练私有化大模型的全流程。课程明确使用GPT-2作为基座而非更先进的GPT-3/4,这恰恰是其实用性的体现:大模型训练资源门槛极高,GPT-2既能完整覆盖预训练、微调的核心逻辑,又允许在个人云端环境(如百度AI Studio)上跑通闭环,是入门私有化模型训练的最佳实践载体。
适合人群为有一定Python基础、熟悉深度学习基本概念(如神经网络前向/反向传播),但缺乏从零训练NLP模型实战经验的学习者。无论是准备转岗AI工程岗,还是希望提升底层原理认知的算法工程师,均可从中找到补强点。课程不追求大而全的论文综述,而是聚焦于“如何让模型在特定数据上生效”的工程路径。
学习路径与核心模块建议
建议按以下顺序突破关键章节:第2章是环境基石,重点理解为何引入PaddlePaddle框架及其与PyTorch的差异,掌握AI Studio平台的基本操作,这是后续代码运行的前提;第3章是原理核心,必须死磕词向量(Word2Vec的CBOW/Skip-gram)、语言模型评估指标(PPL)以及Softmax加速技巧(负采样)。这部分理论若不通,后续微调模型时遇到问题将无法排查。
后续章节将进入实战环节,涵盖数据预处理、模型开发、训练调优及评估。学习中要特别注意“数据准备”这一常被忽视的环节,私有模型的效果七成取决于数据质量。建议配合课程提供的IDE工具(基于GPT-4的Cursor)进行代码辅助编写,提升调试效率,但不要依赖它理解原理。
学后能力与资料配合
完成本课程后,你将能够独立构建一个基础的私有化语言模型,掌握从数据清洗、词向量训练、模型架构搭建到微调优化的完整链路。具体而言,你能解释Transformer之前的经典NLP技术演进,能复现Word2Vec等基础模型,并能基于Paddle框架对GPT类模型进行定向训练和效果评估。这些能力是企业构建专属知识库、低成本部署聊天机器人时的核心竞争力。
资料包中的代码示例和预处理脚本是练习的核心。请勿直接复制粘贴,建议手动输入关键代码片段,并在修改超参数、替换小数据集的过程中观察模型行为变化。通过动手跑通每一个报错和收敛曲线,才能真正将知识转化为可调用的工程技能,从而在面试或实际项目中自信应对私有模型落地的各种挑战。
课程目录
第1章 课程介绍 试看 5 节 | 62分钟 1-1 【导航】课程导学&让你快速了解课程 (18:25) 1-2 【内容安排】课程安排和学习建议 (09:13) 1-3 【行业发展】ChatGPT对行业、社会有什么影响,我们要如何应对 (21:22) 1-4 【发展史】ChatGPT的简要历史 (09:53) 1-5 【学习须知】本课程为什么使用gpt2而不是gpt3 (03:03) 第2章 训练模型与开发平台环境 5 节 | 30分钟 2-1 【认知】为什么要引入paddle?平时使用torch,学习paddle貌似没用怎么办? (04:06) 2-2 【框架】paddle和torch与tensorflow对比 (07:14) 2-3 【NLP工具和预训练模型】paddleNLP和huggingface (03:23) 2-4 【平台】介绍aistudio (07:53) 2-5 【工具】介绍基于gpt4的IDE cursor (06:51) 第3章 chatGPT初始技术词向量原理剖析与实战 12 节 | 176分钟 3-1 【认知】词向量,词向量与gpt的关系 (05:22) 3-2 【语言模型】语言模型和评估指标PPL (13:28) 3-3 【词向量模型】word2vec-cbow和skipgram (08:15) 3-4 【softmax加速】是softmax 树型优化 (14:46) 3-5 【softmax加速】softmax负采样优化 (13:49) 3-6 【数据准备与预处理】word2vec实战(1) (24:53) 3-7 【数据准备与预处理】word2vec实战(2) (18:49) 3-8 【模型训练】word2vec实战-模型开发和训练(1) (15:17) 3-9 【模型训练】word2vec实战-模型开发和训练(2) (14:33) 3-10 【激活函数】常见七种激活函数对比 (15:29) 3-11 【预训练语言模型】RNN-LSTM-ELMO (25:49) 3-12 本章梳理小结 (05:06) 第4章 chatGPT基石模型——基于Transformer架构的语言模型 11 节 | 117分钟 4-1 本章介绍 (01:32) 4-2 seq2seq结构和注意力 (15:23) 4-3 seq2seq-attention的一个案例 (07:37) 4-4 transformer的multi-head attention 多头注意力机制 (23:07) 4-5 transformer的残差链接-解决梯度消失问题 (07:43) 4-6 transformer的layernorm-归一化提升训练稳定性 (07:21) 4-7 transformer的decoder 解码器 (09:11) 4-8 sparse-transformer 稀疏模型 (08:31) 4-9 transformer-xl 解决长序列的问题(1) (14:34) 4-10 transformer-xl解决长序列的问题(2) (16:10) 4-11 本章梳理总结 (04:52) 第5章 基于Transformer另一分支Bert系列分析与实战 16 节 | 211分钟 5-1 本章介绍 (01:14) 5-2 metric-评估指标(BLUE-rouge-L-METOER-NIST) (22:49) 5-3 常见 subword 算法(BPE-wordpiece) (07:00) 5-4 常见的NLP任务 (06:38) 5-5 bert 预训练模型 (25:29) 5-6 bert情感分析实战----paddle(1) (17:22) 5-7 bert情感分析实战----paddle(2) (18:48) 5-8 evaluate和predict方法----paddle (10:49) 5-9 bert(transformer encoder)主要源码分析----paddle(1) (14:12) 5-10 bert(transformer encoder)主要源码分析----paddle(2) (12:31) 5-11 bert(transformer encoder)的完整源码cache部分分析----paddle (15:21) 5-12 Ernie文心一言基础模型(1) (14:35) 5-13 Ernie文心一言基础模型(2) (06:27) 5-14 plato百度对话模型(1) (14:56) 5-15 plato 百度对话模型(2) (14:13) 5-16 本章总结 (07:51) 第6章 chatGPT的核心技术——强化学习 18 节 | 275分钟 6-1 RL是什么&为什么要学习RL (14:11) 6-2 强化学习章介绍 (02:53) 6-3 RL基础概念 (07:06) 6-4 RL马尔可夫过程 (17:39) 6-5 RL三种方法(1) (16:40) 6-6 RL三种方法(2) (06:07) 6-7 DQN和DQN的2种改进算法(1) (13:46) 6-8 DQN和DQN的2种改进算法(2) (16:21) 6-9 actor-critic(1) (24:54) 6-10 actor-critic(2) (08:14) 6-11 TRPO+PPO(1) (23:23) 6-12 TRPO+PPO(2) (18:28) 6-13 DQN代码实践--torch-1 (20:28) 6-14 DQN代码实践--torch-2 (19:05) 6-15 DoubleDQN+DuelingDQ代码--torch (11:49) 6-16 REINFORCE代码--torch (20:18) 6-17 PPO代码实践--torch (23:03) 6-18 强化学习-本章总结 (10:24) 第7章 chatGPT技术演变——从GPT 1 开始的大模型发展与演化 11 节 | 159分钟 7-1 GPT1 模型 (14:46) 7-2 GPT2 模型 (14:00) 7-3 GPT3 模型-1 (15:55) 7-4 GPT3 模型-2 (12:06) 7-5 gpt-codex 基于GPT技术开发的模型 (12:58) 7-6 alphaCode基于GPT技术开发的模型-1 (16:13) 7-7 alphaCode基于GPT技术开发的模型-2 (09:57) 7-8 instruct-gpt 基于GPT技术开发的模型-1 (13:44) 7-9 instruct-gpt 基于GPT技术开发的模型-2 (16:43) 7-10 Antropic LLM大型语言模型 (24:41) 7-11 GPT-本章总结 (07:21) 第8章 RLHF训练类ChatGPT模型代码实战 19 节 | 311分钟 8-1 chatGPT训练实战 (08:52) 8-2 SFT有监督的训练-数据处理 (22:06) 8-3 SFT有监督训练-trainer (18:19) 8-4 SFT有监督训练-train (22:08) 8-5 RM训练-model+dataset(1) (16:33) 8-6 RM训练-model+dataset(2) (14:51) 8-7 RM训练-trainer (13:48) 8-8 RM训练-train-rm (11:43) 8-9 RLHF强化学习人类反馈的训练-dataset (07:50) 8-10 RLHF强化学习人类反馈的训练-model-base (12:17) 8-11 RLHF强化学习人类反馈的训练-model-opt (08:11) 8-12 RLHF强化学习人类反馈的训练-generation(1) (16:53) 8-13 RLHF强化学习人类反馈的训练-generation(2) (16:22) 8-14 RLHF强化学习人类反馈的训练-exp_maker(1) (15:14) 8-15 RLHF强化学习人类反馈的训练-exp_maker(2) (17:18) 8-16 RLHF强化学习人类反馈的训练-buffer-utils (28:18) 8-17 RLHF强化学习人类反馈的训练-buffer-loss (18:08) 8-18 RLHF强化学习人类反馈的训练-trainer (22:03) 8-19 RLHF强化学习人类反馈的训练-main (19:30) 第9章 低成本微调大模型方法PEFT(LoRA等) — 训练 "ChatGLM2" 项目 16 节 | 240分钟 9-1 参数高效微调方法 peft-bitfit (23:14) 9-2 参数高效微调方法 prefix-t (11:55) 9-3 参数高效微调方法 prompt-t (10:09) 9-4 参数高效微调方法 p-tuning (10:38) 9-5 参数高效微调方法 p-tuningv2 (09:36) 9-6 参数高效微调方法 lora (05:13) 9-7 高效调参方案实现 prompt_tuning-1 (18:25) 9-8 高效调参方案实现 prompt_tuning-2 (10:12) 9-9 高效调参方案实现 p-tuning (13:41) 9-10 高效调参方案实现 prefix-tuning (19:42) 9-11 高效调参方案实现 lora-01 (17:51) 9-12 高效调参方案实现 lora-02 (17:40) 9-13 高效调参方案实现 lora-03 (11:00) 9-14 AdaLora微调ChatGLM2 实战 -1 (21:21) 9-15 AdaLora微调ChatGLM2 实战 -2 (23:55) 9-16 PEFT-本章总结 (15:05) 第10章 langchain+训练大模型ChatGLM2 构建“知识库问答” 5 节 | 75分钟 10-1 基于langchain的应用 (12:43) 10-2 langchain初探与实战 (25:31) 10-3 langchain实现 mini-QA (14:59) 10-4 工业场景知识库LLM助手的设计 (13:11) 10-5 langchain和知识增强LLM总结 (08:30) 第11章 课程总结 2 节 | 33分钟 11-1 课程总结(1) (17:48) 11-2 课程总结(2) (15:01)






