核心痛点:无 GPU 时的本地部署
这门课解决的核心问题是:**在没有 NVIDIA 显卡或不愿承担云端推理成本时,如何利用 C++ 在本地 CPU 上高效部署大语言模型**。它不涉及时下热门的训练微调,而是聚焦于“推理落地”的工程闭环。适合具备 C/C++ 基础、熟悉 Git 操作及命令行环境的技术人员。若仅会 Python 调包,建议先补充 CMake 构建系统的基础知识,否则后续编译环节会形成明显阻碍。课程强调动手能力,要求学习者能够独立处理模型权重格式转换、量化压缩以及推理服务的启动。
学习路径与关键能力点
建议按顺序攻克以下内容,以填补从理论到实战的能力缺口。**第一阶段重在环境与数据准备**:优先学习 Git 与 MSYS2 的安装配置,跑通 llama.cpp 的初始演示,建立直观认知。接着深入理解 GGML 量化格式,利用 Conda 搭建 Python 运行环境,完成从 PyTorch 格式到量化格式的转换。这是最容易卡壳的环节,务必亲手复现每一步操作。**第二阶段聚焦中文适配与代码优化**:重点分析 Chinese-LLaMA-Alpaca 模型,学习合并 LoRA 权重,并深入剖析 C++ 源码中关于上下文长度、批次大小及重复惩罚参数的实现逻辑。**学完应能独立做到**:在 Windows 环境下编译 llama.cpp,将开源模型量化为 Q4_0 格式并运行本地推理,通过调整代码参数优化输出质量与响应速度。
资料配合与练习建议
视频资料是理解复杂构建过程的必要辅助,**严禁只看不练**。在观看关于 Visual Studio 配置、CMake 安装及模型转换的章节时,必须同步打开开发环境进行实操,否则无法掌握细节坑点。对于源码分析部分,建议对照视频逐行阅读,尝试修改参数并观察推理结果的变化。通过这种“观看—复现—调试”的循环,才能真正掌握本地部署 LLM 的全流程技能,应对实际工作中的离线部署需求。
课程目录
1-1.课程介绍.mp4 143.28M 1-2.推演程序演示,基于130亿参数模型.mp4 5.43M 2-1.llama模型分析和训练数据分析.mp4 128.13M 2-2.git和msys2安装和llama模型下载.mp4 104.63M 2-3.llama推理测试程序演示.mp4 83.85M 3-1.llama.cpp构建环境说明.mp4 13.44M 3-2.visutal_studio_2022安装.mp4 102.33M 3-3.llama.cpp构建和项目分析.mp4 137.04M 3-4.cmake windows安装二进制版本.mp4 46.13M 4-1.ggml格式介绍.mp4 40.78M 4-2.conda在windows中的安装和使用.mp4 127.75M 4-3.conda的python环境安装.mp4 104.19M 4-4.llama的pth格式转换为ggml的bin.mp4 91.26M 4-5.llama量化模型到Q4_0.mp4 90.28M 5-1.Chinese-LLaMA-Alpaca 中文模型分析和下载.mp4 143.23M 5-2.Transformers安装和llama模型格式转换.mp4 113.85M 5-3.合并中文LoRA权重和llama生成全量模型权重.mp4 104.67M 5-4.使用Transformer和Web图形界面实现推理.mp4 189.27M 5-5.使用llama.cpp量化和推理中文模型.mp4 173.07M 6-1.llama参数ctx-size上下文大小相关代码分析.mp4 101.76M 6-2.predict和batch-size回复数和推理批次代码.mp4 97.78M 6-3.增加结果多样性-重复惩罚repeat-penalty.mp4 181.96M 6-4.21温度改变随机性top-k和top-p算法分析.mp4 110.56M 7-1.开源llamaqt项目分析说明.mp4 34.99M 7-10.XGptFac工厂类创建.mp4 229.25M 7-11.基于cmake配置了推理QT项目.mp4 211.39M 7-12.完成了基于QT的推理交互程序.mp4 146.14M 7-2.基于llama.cpp的cmake项目配置和模型加载代码实现.mp4 171.96M 7-3.完成了推理预处理prompt代码.mp4 163.56M 7-4.完成了推理结果逻辑表采样并输出.mp4 80.37M 7-5.完成了精简版的推理示例程序.mp4 103.11M 7-6.xllama接口类图设计说明.mp4 85.45M 7-7.XGp测试项目和线程启动停止代码完成.mp4 187.06M 7-8.XGpt用户输入和线程接收和回调反馈完成.mp4 154.75M 7-9.完成xllama的推理和反馈接口并测试.mp4 167.62M 51CTO夏曹俊-LLama实战本地CPU推理大语言模型-C++开发实战/ 2-1





