很多人学神经网络,卡住的地方其实很具体:反向传播的链式法则能背,但一到自己推就乱;损失函数会调包,却说不清它和 Softmax 配在一起时梯度长什么样;看懂了单个神经元,一换成矩阵形式就不知道维度怎么对的。这门课对准的就是这类缺口——它不讲"深度学习有多重要",而是把前向传播、反向传播、梯度下降、参数更新这几步拆开揉碎,让你能在纸上把一轮训练走完。
先确认你是不是它的目标读者
如果你属于下面几种情况之一,这门课的性价比会比较高:
- 用过 PyTorch 或 TensorFlow 搭过模型,但把
loss.backward()当成黑盒,从没自己算过一遍梯度; - 面试被问到"为什么用交叉熵而不是 MSE 做分类",只能答"大家都这么用";
- 知道卷积、池化的大致作用,但说不清感受野、步长、通道数变化时张量形状怎么走;
- 数学基础停在大一高数和线性代数,看到偏导、雅可比、链式法则就发怵,需要有人把符号和代码对应起来。
反过来,如果你已经能手推 MLP 和 CNN 的反向传播、能自己写优化器,这门课对你来说偏基础,可以直接跳过。
核心不是"讲原理",是让你把符号和代码对上
神经网络的学习门槛,一大半来自"同一件事有三套语言":数学用偏导和矩阵,框架用张量和算子,代码用循环和索引。这三套语言之间的翻译,才是真正要练的东西。
这门课的重点内容大致落在这些位置:
- 单个神经元的加权求和 + 激活,如何扩展到一层、再到多层的前向计算;
- 反向传播的链式法则推导:从输出层误差往回传,每一步的局部梯度怎么求、为什么能复用;
- 常见激活函数(Sigmoid、Tanh、ReLU 及其变体)的导数形式,以及它们如何影响梯度消失;
- Softmax + 交叉熵组合后梯度为什么能化简成"预测减真实",这个化简过程值得自己推一遍;
- 梯度下降、随机梯度下降、动量、Adam 的更新公式差异,以及学习率对收敛的实际影响;
- 过拟合与正则化:L2、Dropout 在训练和推理阶段的行为差异;
- 卷积层的参数量、输出尺寸计算,以及池化对梯度回传的影响。
这些东西单独看都不难,难的是连起来。课程的价值在于把这条链走通,而不是把每个知识点孤立地讲一遍。
配套练习该怎么用
光看推导不动手,两周就忘。建议按这个节奏来:
- 每学完一个前向/反向的推导,用 NumPy 手写一个最小实现,只用一个隐藏层、一个样本,先把数字跑对;
- 再拿同样的结构用框架实现一遍,对比两边的梯度值是否一致——不一致就说明你对某个算子的理解有偏差,这比看十遍公式有用;
- 把激活函数、损失函数、优化器做成可替换的模块,换一次跑一次,观察 loss 曲线的变化;
- 章节笔记不要抄公式,改成写"这一节我原来以为……实际上……",面试前翻这个比翻教材快。
看完应该能回答的问题
用这几个问题自测,能答上来就说明这一轮没白学:
- 反向传播里,为什么同一层的权重梯度可以共用上游传来的误差项?
- ReLU 的导数在 0 点不可导,实际代码里是怎么处理的,会带来什么问题?
- Softmax 交叉熵的梯度为什么能写成
ŷ - y?如果是 MSE 配 Sigmoid,梯度会变成什么形式? - 一个 3×3 卷积、输入 32 通道、输出 64 通道,参数量是多少?加上偏置呢?
- Batch Size 变大时,学习率通常要怎么调整,为什么?
- Dropout 在训练和推理时分别做了什么,为什么推理时要缩放?
这些问题答不上来的,就是你还缺的那块。带着问题去学,比从头到尾刷一遍效率高得多。
image.webp 下载附件 保存到相册 2025-6-9 01:13 上传
课程推荐
《深度学习之神经网络核心原理与算法》image.webp 下载附件 保存到相册 2025-6-9 01:13 上传【技能收获】学完可掌握:核心实战技能、项目驱动学习。课程以实战为导向,覆盖从基础概念到完整项目落地的关键步骤,配套章节笔记便于课后复盘与面试前快速回顾。【学习建议】建议按目录顺序学习,先打基础再进入综合实战章节;每完成 2~3 节可结合笔记整理一份学习小结,最终尝试独立复现一套完整 Demo 写入个人作品集。【就业发展】可面向岗位:AI 应用工程师、RAG 系统开发、Java 后端 + 大模型落地、企业知识库架构师。大模型应用岗需求持续走高,具备「后端 + RAG 落地」复合能力的人才在招聘市场更稀缺,简历中可突出完整项目链路而非仅会使用 API。 若你已有一定编程或运维基础,本课程可帮助你在现有技能栈上快速叠加热门方向能力,提升求职时的项目说服力与薪资谈判空间。
视频目录(58 节)
* 1-1 课程—导学 (0742).mp4
* 1-2 课前准备 (2148).mp4
* 1-3 深度学习简介—-神经元 (1131).mp4
* 1-4 深度学习简介—-激励函数 (0733).mp4
* 1-5 深度学习简介—神经网络和深度神经网络 (0421).mp4
* 1-6 深度学习为什么这么强 (0339).mp4
* 1-7 深度学习的应用 (0227).mp4
* 2-1 网络结构 (0326).mp4
* 2-2 网络结构_代码部分 (1338).mp4
* 2-3 线性回归的训练--样本,开始训练 (0905).mp4
* 2-4 线性回归的训练--梯度下降法,一元凸函数 (0847).mp4
* 2-5 线性回归的训练--二元凸函数 (0654).mp4
* 2-6 神经网络的训练--前向传播 (0441).mp4
* 2-7 神经网络的训练--前向传播代码部分 (0727).mp4
* 2-8 神经网络的训练--反向传更新 (0535).mp4
* 2-9 神经网络的训练--反向传更新_代码部分 (1919).mp4
* 2-10 神经网络的训练--随机梯度下降 (0210).mp4
* 2-11 神经网络的训练--随机梯度下降代码部分 (0451).mp4
* 2-12 应用案例—-前馈神经网络代码的手写数字识别 (1346).mp4
* 3-1 并行计算 (0729).mp4
* 3-2 梯度消失问题 (0852).mp4
* 3-3 归一化 (0507).mp4
* 3-4 参数初始化问题 (0355).mp4
* 3-5 参数的初始化问题-代码实现 (0323).mp4
* 3-6 正则化 (1055).mp4
* 3-7 正则化-代码实现 (0153).mp4
* 3-8 学习率和dropout (0304).mp4
* 3-9 交叉熵 (0812).mp4
* 3-10 交叉熵-代码实现 (0636).mp4
* 3-11 模型的保存和加载及代码实现 (1127).mp4
* 3-12 应用案例—-提高版本的前馈神经网络代码的手写数字识别 (1516).mp4
* 4-1 与全连接网络的对比 (0514).mp4
* 4-2 全连接层GPU实现 代码实现 (2508).mp4
* 4-3 卷积核 (0608).mp4
* 4-4 卷积层其他参数 (0446).mp4
* 4-5 池化层 (0416).mp4
* 4-6 卷积池化层 代码实现 (0616).mp4
* 4-7 典型CNN网络 (0639).mp4
* 4-8 图片识别 (0434).mp4
* 4-9 softmax (0412).mp4
* 4-10 softmax层 代码实现 (0338).mp4
* 4-11 应用案例—-卷积神经网络代码的手写数字识别 (1805).mp4
* 5-1 tensorflow简介 (1514).mp4
* 5-2 如何选择好的框架:tensorflow的优势 (0630).mp4
* 5-3 多环境与集群支持 (0533).mp4
* 5-4 应用案例—-tensorflow版本的线性回归的实现 (1204).mp4
* 5-5 tensorboard (0539).mp4
* 5-6 tensorboard 使用演示 (0558).mp4
* 5-7 训练模型的加载与保存 (0646).mp4
* 5-8 应用案例—-tensorflow版本的手写数字识别 (1629).mp4
* 6-1 .简介 (0357).mp4
* 6-2 .tensorflow单GPU版本上 (1219).mp4
* 6-3 .tensorflow单GPU版本下 (1113).mp4
* 6-4 tensorflow多GPU版本 (0756).mp4
* 7-1 caffe应用对比(上) (1527).mp4
* 7-2 caffe应用对比(下) (1301).mp4
* 7-3 keras应用对比 (1644).mp4
* 8-1 课程总结_ (0354).mp4






