很多人用 Llama2 或 ChatGLM 的方式是:拉一个开源权重,套一段 prompt,跑通了就结束。一旦要改结构、要压显存、要让模型调用外部工具,就卡住。这门训练营针对的正是这类缺口——它不是再讲一遍 Transformer 是什么,而是逼你从源码层面把模型拆开,再一步步装回去。

先确认自己缺的是哪一块

这门课对学习者的起点有明确假设:你能看懂 Python,写过 PyTorch 的基础训练循环,知道注意力机制大概在算什么。如果这些还不牢,直接上手写 Llama2 会变成抄代码。反过来说,如果你已经能跑通 HuggingFace 的 Trainer,但说不清 model.generate() 里 KV Cache 是怎么复用的、LoRA 的 A/B 矩阵挂在哪一层,那这门课正好补的就是这层「知其所以然」。

建议先自测三个问题:Llama2 的 RMSNorm 和 LayerNorm 差在哪?DP 和 DDP 在梯度同步上的区别是什么?函数调用时模型输出的那段结构化文本,是谁在解析?三个都答不上来,按顺序学;只卡在最后一个,可以直接跳到项目实践部分。

手写 Llama2 不是重造轮子

从零实现 Llama2 的价值不在于你以后要自己发模型,而在于建立一套「可修改」的心智模型。你会碰到 RoPE 旋转位置编码的具体实现、GQA 分组查询注意力的头数分配、SwiGLU 前馈层的维度设计,以及权重加载时怎么和官方 checkpoint 对齐。这些细节只有在手写时才会暴露——调包时它们全被封装掉了。

配套练习的重点是「对答案」:写完一个模块,用同样的输入和官方实现比对输出,误差在容忍范围内才算过。这个过程比看视频更耗时间,但也是唯一能确认自己真的写对了的方式。

微调部分要落到 ChatGLM 的具体操作

微调板块围绕 ChatGLM 展开,涉及数据构造、指令格式对齐、训练参数设置和效果验证。这里容易踩的坑不是代码,而是数据:指令微调的效果很大程度取决于样本格式是否和基座模型的预训练格式一致,以及 loss 是不是只算在回答部分。课程资料里有对应的数据模板,但导入自己的数据时需要重新处理,这部分得动手改。

另一个现实问题是显存。全量微调 ChatGLM 这类模型对硬件有要求,所以要理解 LoRA 等参数高效方法的插入位置、秩的选取,以及合并权重后推理的差异。学完应该能回答:LoRA 训练时哪些参数被冻结?合并后模型大小为什么没变?

DP 分布式:理解它为什么常被 DDP 取代

Data Parallel 是分布式训练的入门形态,原理直观,但工程上问题不少——主卡负载不均、通信效率低。课程把它单独拿出来讲,目的不是让你在生产里用 DP,而是让你理解数据并行这条线上的基本概念:梯度怎么汇总、batch 怎么切分、多卡之间怎么同步。

把 DP 搞清楚之后,再去看 DDP 或更复杂的并行策略,就不会只是背概念。学这块时建议真的用多卡(哪怕是两张小卡)跑一次,观察显存占用和吞吐的变化,比纯看讲解有效得多。

函数调用与代码解释器:把模型接进真实流程

最后的项目实践包括函数调用和代码解释器两个方向。函数调用的核心不是让模型「会调 API」,而是设计好工具描述、约束模型输出格式、在外部正确解析并执行、再把结果拼回对话。这条链路任何一环出错,模型看起来都像在胡说。

代码解释器则更接近一个完整的小系统:模型生成代码、沙箱执行、捕获结果或异常、决定是否重试。做完这个项目,应该能回答:模型输出不符合格式时怎么兜底?执行超时或报错时,错误信息以什么形式反馈给模型?这些才是从「会跑 demo」到「能交付」之间的差距。

整体来看,这门训练营适合愿意花时间动手、并且能接受「写错—比对—重写」这种节奏的人。只看不练的话,收获会非常有限。

保姆级LLM大模型训练营:手写Llama2 + ChatGLM微调 + DP分布式 + 函数调用项目实践

从零开始,掌握LLM大模型实践技能

编辑点评

深入浅出,理论与实践结合,适合初学者和进阶者。

⭐ 编辑推荐

本训练营带你从Llama2源码入手,通过手写微调、分布式训练和函数调用项目实践,全面掌握LLM大模型技术。

课程亮点

• 手写Llama2源码
• ChatGLM微调
• DP分布式训练
• 项目实践

课程目录

📁 LLM大模型视频
📁     📁 布丁部分
📁         📁 4_function_call
            4_function_call资料.zip  [1.8 MB]
📁         📁 5_code_interpreter
📁         📁 3_微调
            3_微调资料.zip  [1.8 MB]
📁         📁 1_环境
            1_环境资料.png  [493.5 KB]
📁         📁 2_prompt
        9_prompt_改写任务1_92004_7443.mp4  [62.5 MB]
        8_prompt_技巧2_92004_9018.mp4  [42.3 MB]
        55_手写项目_92004_2250.mp4  [289.2 MB]
        7_prompt_技巧_92004_1226.mp4  [88.9 MB]
        5_vscode远程debug配置.mp4_92004_3201.mp4  [82.6 MB]
        6_prompt_概述_92004_3702.mp4  [15.9 MB]
        53_akshare接口_92004_1877.mp4  [49.7 MB]
        54_gradio-界面设计_92004_4973.mp4  [40.9 MB]
        50_手写code-interpreter_92004_9161.mp4  [140.9 MB]
        52_项目演示_92004_7303.mp4  [13.4 MB]
        51_code-interpreter进阶_92004_2981.mp4  [72.7 MB]
        4_vscode远程连接服务器.mp4_92004_2166.mp4  [34.7 MB]
        49_code-interpreter-概述_92004_9343.mp4  [26.2 MB]
        46-手写function_call-2_92004_8197.mp4  [158.5 MB]
        48_function-all_官方代码逐行解读_92004_3423.mp4  [97.2 MB]
        47-streamlit-debug环境配置_92004_8062.mp4  [42.9 MB]
        45-手写function_call-1_92004_9993.mp4  [66.1 MB]
        44-function-call实例1_92004_4232.mp4  [49.2 MB]
        43-function_call概述2_92004_6180.mp4  [24.3 MB]
        40-codegeex-微调数据处理_92004_1841.mp4  [137.7 MB]
        41-codegeex-微调结果评测_92004_8524.mp4  [48.9 MB]
        42-function-call概述_92004_6764.mp4  [30.4 MB]
        3_配置服务器jupyter环境.mp4_92004_9365.mp4  [75.4 MB]
        38-微调优化_92004_2294.mp4  [94.6 MB]
        39-codegeex微调-数据准备_92004_5237.mp4  [43.2 MB]
        37_微调结束后-推理_92004_8087.mp4  [48.3 MB]
        33_cha_92004_7508.mp4  [215.4 MB]
        36_微调模型加载1_92004_1639.mp4  [36.8 MB]
        34_cha_92004_4112.mp4  [137.2 MB]
        35_微调结果评测_92004_2611.mp4  [25.1 MB]
        32_cha_92004_2181.mp4  [114.6 MB]
        31_推理、训练、量化占用显存_92004_9704.mp4  [83.6 MB]
        30_glm2的tokenizer_92004_8464.mp4  [49.5 MB]
        2_模型文件下载方法2.mp4_92004_5849.mp4  [37.2 MB]
        29_流式与非流式_chat_generate_92004_3743.mp4  [52.3 MB]
        28_cha_92004_1037.mp4  [53.9 MB]
        25_deepspeed_bert_4_92004_8823.mp4  [161.3 MB]
        27_cha_92004_4594.mp4  [53.0 MB]
        26_deepspeed_多机多卡配置_92004_3616.mp4  [37.0 MB]
        24_deepspeed_bert_3_92004_1479.mp4  [59.3 MB]
        23_deepspeed_bert_2_92004_5480.mp4  [8.5 MB]
        22_deepspeed_bert_1_92004_4161.mp4  [44.2 MB]
        21_deepspeed_demo实例_92004_7514.mp4  [42.4 MB]
        1_模型文件下载方法1.mp4_92004_1768.mp4  [31.9 MB]
        19_deepspeed_配置_92004_4449.mp4  [38.5 MB]
        18_deepspeed_概述_92004_2977.mp4  [59.8 MB]
        17_prompt_数据制作4_92004_2197.mp4  [122.4 MB]
        16_prompt_数据制作3_92004_5204.mp4  [87.7 MB]
        15_prompt_数据制作2_92004_3970.mp4  [27.5 MB]
        13_prompt角色扮演_92004_6573.mp4  [121.1 MB]
        14_prompt_数据制作1_92004_2551.mp4  [45.8 MB]
        12_prompt_抽取任务2_92004_3683.mp4  [90.3 MB]
        11_prompt_抽取任务1_92004_1836.mp4  [54.2 MB]
        10_prompt_改写任务2_92004_2017.mp4  [72.2 MB]
        0_课程介绍_92004_5818.mp4  [27.9 MB]
📁     📁 季康部分
📁         📁 3_高效微调
            3_高效微调必看.zip  [1.8 MB]
📁         📁 1_LLM综述
            1_LLM综述文档.png  [493.5 KB]
📁         📁 2_手写llama2源码
            2_手写llama2源码文档.png  [493.5 KB]
        9-1.6ptuningv2_代码2_92004_5740.mp4  [147.3 MB]
        9-1.3ptuningv1原理以及代码_92004_8067.mp4  [184.6 MB]
        9-1.5ptuningv2_代码1_92004_2734.mp4  [47.7 MB]
        9-1.4ptuningv2原理_92004_1843.mp4  [15.8 MB]
        9-1.2pet模型和训练验证_92004_2807.mp4  [108.5 MB]
        9-1.1pet原理&dataloader_92004_8222.mp4  [149.6 MB]
        8-1.9_llama2模型组装_92004_2995.mp4  [113.3 MB]
        8-1.6_Llama2的Attention_代码_ev_92004_3748.mp4  [250.7 MB]
        8-1.8_Llama2的ffn_代码_92004_2605.mp4  [34.8 MB]
        8-1.7_Llama2的ffn_原理_92004_8361.mp4  [10.7 MB]
        8-1.6_Llama2的Attention_代码_92004_6038.mp4  [193.6 MB]
        8-1.5_Llama2的Attention_原理_92004_5253.mp4  [43.7 MB]
        8-1.3_Llama2的ROPE_原理_92004_4078.mp4  [155.4 MB]
        8-1.4_Llama2的ROPE_代码_92004_7272.mp4  [91.1 MB]
        8-1.2_Llama2的rmsnorm_代码_92004_1008.mp4  [50.1 MB]
        8-1.1_Llama2的rmsnorm_原理_92004_1310.mp4  [37.2 MB]
        7-llm自动生成prompts_92004_7338.mp4  [46.3 MB]
        6-1.5_llm的知识编辑_92004_3017.mp4  [48.9 MB]
        季康部分必看.zip  [1.8 MB]
        6-1.4_llm幻觉的常见的解决方式_92004_6368.mp4  [35.5 MB]
        9-1.7ptuningv2_代码3_92004_9095.mp4  [4.9 MB]
        6-1.3幻觉产生的原因_92004_5433.mp4  [29.3 MB]
        6-1.2幻觉的评估方法_92004_8266.mp4  [17.8 MB]
        6-1.1_llm的幻觉定义_92004_5099.mp4  [34.3 MB]
        5-llm的评价标准_92004_4969.mp4  [39.2 MB]
        4-llm的常见架构_92004_6882.mp4  [76.7 MB]
        3-llm的训练流程以及常见的概念_92004_5797.mp4  [96.4 MB]
        2-llm的发展历程_part2_92004_8398.mp4  [66.9 MB]
        2-llm的发展历程_part1_92004_5317.mp4  [45.1 MB]
        10.1.9_qlora的nf4_92004_8999.mp4  [41.8 MB]
        10.1.9_qlora的双重量化_92004_1368.mp4  [18.3 MB]
        10-1.8_int8量化原理_92004_2856.mp4  [57.0 MB]
        10.1.10_qlora的代码_92004_4844.mp4  [24.9 MB]
        10-1.6_lora推理部分_问题生成_92004_5538.mp4  [135.5 MB]
        10-1.7_lora_推理_fewshot回答_92004_5391.mp4  [58.8 MB]
        10-1.4_llama2环境安装以及部分bug排查_92004_2890.mp4  [220.0 MB]
        10-1.5_lora训练_92004_8425.mp4  [147.0 MB]
        10-1.2_rams数据处理_2_92004_4180.mp4  [77.9 MB]
        10-1.3_lora原理部分介绍_92004_4962.mp4  [40.0 MB]
        10-1.1_llama2任务简介_92004_2803.mp4  [136.5 MB]
        10-1.2_rams数据处理_1_92004_8523.mp4  [91.7 MB]
        1-llm简要概览_92004_2031.mp4  [16.0 MB]
        0-课程大纲简要说明_92004_7237.mp4  [6.7 MB]
    LLM大模型视频必看.png  [493.5 KB]
📁 文档
    大语言模型(Large Language Model,LLM)综述_92004_4522.pdf  [4.6 MB]
    sft高效微调_92004_5822.pdf  [1.8 MB]
    面试_92004_7809.pdf  [362.2 KB]
    配置服务器的jupyter环境_92004_3083.pdf  [193.2 KB]
    手写llama2源码_92004_7733.pdf  [541.5 KB]
    文档必看.png  [493.5 KB]

适合人群

  • LLM初学者
  • AI工程师
  • 数据科学家

学习收获

掌握LLM大模型基本原理
实现LLM微调与优化
进行分布式训练与部署

祝您学习愉快!

学有所成,前程似锦!