很多人学神经网络,卡住的地方其实很具体:反向传播的链式法则能背,但一到自己推就乱;损失函数会调包,却说不清它和 Softmax 配在一起时梯度长什么样;看懂了单个神经元,一换成矩阵形式就不知道维度怎么对的。这门课对准的就是这类缺口——它不讲"深度学习有多重要",而是把前向传播、反向传播、梯度下降、参数更新这几步拆开揉碎,让你能在纸上把一轮训练走完。

先确认你是不是它的目标读者

如果你属于下面几种情况之一,这门课的性价比会比较高:

  • 用过 PyTorch 或 TensorFlow 搭过模型,但把 loss.backward() 当成黑盒,从没自己算过一遍梯度;
  • 面试被问到"为什么用交叉熵而不是 MSE 做分类",只能答"大家都这么用";
  • 知道卷积、池化的大致作用,但说不清感受野、步长、通道数变化时张量形状怎么走;
  • 数学基础停在大一高数和线性代数,看到偏导、雅可比、链式法则就发怵,需要有人把符号和代码对应起来。

反过来,如果你已经能手推 MLP 和 CNN 的反向传播、能自己写优化器,这门课对你来说偏基础,可以直接跳过。

核心不是"讲原理",是让你把符号和代码对上

神经网络的学习门槛,一大半来自"同一件事有三套语言":数学用偏导和矩阵,框架用张量和算子,代码用循环和索引。这三套语言之间的翻译,才是真正要练的东西。

这门课的重点内容大致落在这些位置:

  • 单个神经元的加权求和 + 激活,如何扩展到一层、再到多层的前向计算;
  • 反向传播的链式法则推导:从输出层误差往回传,每一步的局部梯度怎么求、为什么能复用;
  • 常见激活函数(Sigmoid、Tanh、ReLU 及其变体)的导数形式,以及它们如何影响梯度消失;
  • Softmax + 交叉熵组合后梯度为什么能化简成"预测减真实",这个化简过程值得自己推一遍;
  • 梯度下降、随机梯度下降、动量、Adam 的更新公式差异,以及学习率对收敛的实际影响;
  • 过拟合与正则化:L2、Dropout 在训练和推理阶段的行为差异;
  • 卷积层的参数量、输出尺寸计算,以及池化对梯度回传的影响。

这些东西单独看都不难,难的是连起来。课程的价值在于把这条链走通,而不是把每个知识点孤立地讲一遍。

配套练习该怎么用

光看推导不动手,两周就忘。建议按这个节奏来:

  • 每学完一个前向/反向的推导,用 NumPy 手写一个最小实现,只用一个隐藏层、一个样本,先把数字跑对;
  • 再拿同样的结构用框架实现一遍,对比两边的梯度值是否一致——不一致就说明你对某个算子的理解有偏差,这比看十遍公式有用;
  • 把激活函数、损失函数、优化器做成可替换的模块,换一次跑一次,观察 loss 曲线的变化;
  • 章节笔记不要抄公式,改成写"这一节我原来以为……实际上……",面试前翻这个比翻教材快。

看完应该能回答的问题

用这几个问题自测,能答上来就说明这一轮没白学:

  • 反向传播里,为什么同一层的权重梯度可以共用上游传来的误差项?
  • ReLU 的导数在 0 点不可导,实际代码里是怎么处理的,会带来什么问题?
  • Softmax 交叉熵的梯度为什么能写成 ŷ - y?如果是 MSE 配 Sigmoid,梯度会变成什么形式?
  • 一个 3×3 卷积、输入 32 通道、输出 64 通道,参数量是多少?加上偏置呢?
  • Batch Size 变大时,学习率通常要怎么调整,为什么?
  • Dropout 在训练和推理时分别做了什么,为什么推理时要缩放?

这些问题答不上来的,就是你还缺的那块。带着问题去学,比从头到尾刷一遍效率高得多。


image.webp 下载附件   保存到相册 2025-6-9 01:13 上传

课程推荐

《深度学习之神经网络核心原理与算法》image.webp 下载附件   保存到相册 2025-6-9 01:13 上传【技能收获】学完可掌握:核心实战技能、项目驱动学习。课程以实战为导向,覆盖从基础概念到完整项目落地的关键步骤,配套章节笔记便于课后复盘与面试前快速回顾。【学习建议】建议按目录顺序学习,先打基础再进入综合实战章节;每完成 2~3 节可结合笔记整理一份学习小结,最终尝试独立复现一套完整 Demo 写入个人作品集。【就业发展】可面向岗位:AI 应用工程师、RAG 系统开发、Java 后端 + 大模型落地、企业知识库架构师。大模型应用岗需求持续走高,具备「后端 + RAG 落地」复合能力的人才在招聘市场更稀缺,简历中可突出完整项目链路而非仅会使用 API。 若你已有一定编程或运维基础,本课程可帮助你在现有技能栈上快速叠加热门方向能力,提升求职时的项目说服力与薪资谈判空间。

视频目录(58 节)

*   1-1 课程—导学  (0742).mp4

*   1-2 课前准备  (2148).mp4

*   1-3 深度学习简介—-神经元  (1131).mp4

*   1-4 深度学习简介—-激励函数  (0733).mp4

*   1-5 深度学习简介—神经网络和深度神经网络  (0421).mp4

*   1-6 深度学习为什么这么强  (0339).mp4

*   1-7 深度学习的应用  (0227).mp4

*   2-1 网络结构  (0326).mp4

*   2-2 网络结构_代码部分  (1338).mp4

*   2-3 线性回归的训练--样本,开始训练  (0905).mp4

*   2-4 线性回归的训练--梯度下降法,一元凸函数  (0847).mp4

*   2-5 线性回归的训练--二元凸函数  (0654).mp4

*   2-6 神经网络的训练--前向传播  (0441).mp4

*   2-7 神经网络的训练--前向传播代码部分  (0727).mp4

*   2-8 神经网络的训练--反向传更新  (0535).mp4

*   2-9 神经网络的训练--反向传更新_代码部分  (1919).mp4

*   2-10 神经网络的训练--随机梯度下降  (0210).mp4

*   2-11 神经网络的训练--随机梯度下降代码部分  (0451).mp4

*   2-12 应用案例—-前馈神经网络代码的手写数字识别  (1346).mp4

*   3-1 并行计算  (0729).mp4

*   3-2 梯度消失问题  (0852).mp4

*   3-3 归一化  (0507).mp4

*   3-4 参数初始化问题  (0355).mp4

*   3-5 参数的初始化问题-代码实现  (0323).mp4

*   3-6 正则化  (1055).mp4

*   3-7 正则化-代码实现  (0153).mp4

*   3-8 学习率和dropout  (0304).mp4

*   3-9 交叉熵  (0812).mp4

*   3-10 交叉熵-代码实现  (0636).mp4

*   3-11 模型的保存和加载及代码实现  (1127).mp4

*   3-12 应用案例—-提高版本的前馈神经网络代码的手写数字识别  (1516).mp4

*   4-1 与全连接网络的对比  (0514).mp4

*   4-2 全连接层GPU实现 代码实现  (2508).mp4

*   4-3 卷积核  (0608).mp4

*   4-4 卷积层其他参数  (0446).mp4

*   4-5 池化层  (0416).mp4

*   4-6 卷积池化层 代码实现  (0616).mp4

*   4-7 典型CNN网络  (0639).mp4

*   4-8 图片识别  (0434).mp4

*   4-9 softmax  (0412).mp4

*   4-10 softmax层 代码实现  (0338).mp4

*   4-11 应用案例—-卷积神经网络代码的手写数字识别  (1805).mp4

*   5-1 tensorflow简介  (1514).mp4

*   5-2 如何选择好的框架:tensorflow的优势  (0630).mp4

*   5-3 多环境与集群支持  (0533).mp4

*   5-4 应用案例—-tensorflow版本的线性回归的实现  (1204).mp4

*   5-5 tensorboard  (0539).mp4

*   5-6 tensorboard 使用演示  (0558).mp4

*   5-7 训练模型的加载与保存  (0646).mp4

*   5-8 应用案例—-tensorflow版本的手写数字识别  (1629).mp4

*   6-1 .简介  (0357).mp4

*   6-2 .tensorflow单GPU版本上  (1219).mp4

*   6-3 .tensorflow单GPU版本下  (1113).mp4

*   6-4 tensorflow多GPU版本  (0756).mp4

*   7-1 caffe应用对比(上)  (1527).mp4

*   7-2 caffe应用对比(下)  (1301).mp4

*   7-3 keras应用对比  (1644).mp4

*   8-1 课程总结_  (0354).mp4