多模态大模型训练营导读:拒绝空谈,只练能落地的工程能力
解决什么核心痛点?
当前很多学习者面对“多模态”概念一头雾水,要么只会调 API 跑通 Demo,却不懂背后的原理,要么死磕底层数学推导导致项目迟迟无法落地。本课程专门解决“懂理论但写不出代码”以及“能跑通模型但无法在实际业务中应用”的痛点。通过从机器学习基础到多模态大模型微调的完整链路,带你打通从数据准备、模型训练到最终业务落地的全闭环,让你真正掌握驾驭多模态模型的核心工程能力。
适合什么基础?建议先看哪几块?
课程设定为“缺什么补什么”的进阶路线,不预设你必须是 AI 专家。如果你具备 Python 基础但从未接触过机器学习,建议优先看完第 1 周的“机器学习与深度学习基础”,快速补齐梯度下降、反向传播等前置知识,否则后续微调章节会非常吃力;如果你已有 PyTorch 基础,可直接跳过前两周的铺垫,重点精读第 3 周的“大模型微调与落地”及第 4 周的多模态实战内容。此外,第 0 周的开营直播回放是必读首选,它能帮你建立正确的学习心态,避免陷入“假努力”的误区。
学完能独立做什么?如何配合资料练习?
学完本课程,你将能独立基于开源模型(如 LLaVA、Qwen-VL 等)进行多模态微调,解决如“电商图片描述生成”、“文档内容智能问答”等实际业务问题,而不再依赖昂贵的闭源 API。配合提供的视频资料包时,请务必遵循“边看边敲”原则:观看第 2 周 PyTorch 基础时,立即在本地环境复现 Tensor 操作;观看第 4 周多模态实战时,尝试替换自己的数据集(如将电商 SKU 换成新闻配图)重新跑通训练流程。不要只盯着视频里的代码运行结果,必须亲手修改数据预处理逻辑和损失函数,这才是从“观众”转变为“开发者”的关键。
课程目录
第0周:直播答疑+开营直播回放 | ├──0-1 开营直播回放.ts_ev.mp4 149.76M | ├──0-2 直播答疑-20251025.ts_ev.mp4 97.08M | ├──0-3 直播答疑-20251108.ts_ev.mp4 145.30M | └──0-4 直播答疑-20251122.ts_ev.mp4 233.97M 第1周:机器学习与深度学习基础(上) | ├──1-1 课程概述.ts_ev.mp4 66.39M | ├──1-2 常见机器学习任务与算法:机器学习任务类型.ts_ev.mp4 57.09M | ├──1-3 常见机器学习任务与算法:机器学习十大算法.ts_ev.mp4 111.67M | ├──1-4 常见机器学习任务与算法:机器学习的任务步骤.ts_ev.mp4 91.38M | ├──1-5 深度学习任务版图.ts_ev.mp4 75.26M | └──1-6 深度学习算法.ts_ev.mp4 71.32M 第2周:机器学习与深度学习基础(下) | ├──2-1 深度学习训练要素.ts_ev.mp4 101.57M | ├──2-2 强化学习最小闭环.ts_ev.mp4 121.43M | ├──2-3 PyTorch基础与工程要素.ts_ev.mp4 51.20M | └──2-4 实战:电商SKU卡生成.ts_ev.mp4 91.31M 第3周:大模型微调与落地(上) | ├──3-1 大模型的演进历史(一).ts_ev.mp4 87.85M | ├──3-2 大模型的演进历史(二).ts_ev.mp4 87.96M | ├──3-3 从AI到AGI到ASI(一).ts_ev.mp4 84.49M | ├──3-4 从AI到AGI到ASI(二).ts_ev.mp4 81.62M | └──3-5 Transformer核心原理.ts_ev.mp4 122.07M 第4周:大模型微调与落地(下) | ├──4-1 Transformer核心原理的演示.ts_ev.mp4 231.80M | ├──4-2 知识工程与多模态RAG.ts_ev.mp4 131.42M | ├──4-3 微调方法与参数高效训练(一).ts_ev.mp4 113.99M | ├──4-4 微调方法与参数高效训练(二).ts_ev.mp4 100.23M | ├──4-5 提示词工程和模型压缩优化.ts_ev.mp4 94.95M | └──4-6 实战:可溯源的问答助手.ts_ev.mp4 77.04M 第5周:多模态全景认知 | ├──5-1 多模态的定义与边界.ts_ev.mp4 46.90M | ├──5-2 多模态数据与表征.ts_ev.mp4 74.60M | ├──5-3 多模态模型架构.ts_ev.mp4 64.79M | ├──5-4 多模态任务类型.ts_ev.mp4 30.91M | ├──5-5 多模态应用场景.ts_ev.mp4 54.26M | ├──5-6 多模态实战.ts_ev.mp4 167.53M | └──5-7 音频模态扩展.ts_ev.mp4 25.07M 第6周:虚拟人生成与交互技术 | ├──6-1 虚拟人生成全景.ts_ev.mp4 45.67M | ├──6-2 图像生成与条件控制(一).ts_ev.mp4 134.66M | ├──6-3 图像生成与条件控制(二).ts_ev.mp4 107.45M | ├──6-4 虚拟人的大脑.ts_ev.mp4 130.88M | ├──6-5 虚拟人的声音情感.ts_ev.mp4 150.69M | ├──6-6 虚拟人的口型与驱动.ts_ev.mp4 149.67M | ├──6-7 虚拟人直播.ts_ev.mp4 45.19M | └──6-8 虚拟人案例实操.ts_ev.mp4 109.57M 第7周:多模态 OCR 与智能翻译链路 | ├──7-1 OCR的全景认知.ts_ev.mp4 69.00M | ├──7-2 传统OCR技术机制.ts_ev.mp4 118.68M | ├──7-3 生成式与Transformer式OCR(一).ts_ev.mp4 96.52M | ├──7-4 生成式与Transformer式OCR(二).ts_ev.mp4 89.87M | ├──7-5 版面与表格结构解析.ts_ev.mp4 119.49M | ├──7-6 手写OCR与多语种.ts_ev.mp4 103.73M | └──7-7 OCR到翻译链路与RAG落地.ts_ev.mp4 79.82M 资料 | └──【资料】多模态大模型训练营.zip 191.02M ——/多模态大模型训练营/├──第0周:直播答疑+开营直播回放 | ├──0-1 开营直播回放.ts_ev.mp4 149.76M| ├──0-2 直播答疑-20251025.ts_ev.mp4 97.0 多模态大模型训练营【VIP】






