课程目录
1-1 [强化学习简介及其应用] 课程介绍 (02:54) 1-2 [强化学习简介及其应用] 一张图通俗解释强化学习 (04:47) 1-3 [强化学习简介及其应用] 强化学习的指导依据 (07:07) 1-4 [强化学习简介及其应用] 强化学习AI游戏DEMO (04:48) 1-5 [强化学习简介及其应用] 应用领域简介 (06:28) 1-6 [强化学习简介及其应用] 强化学习工作流程 (05:48) 1-7 [强化学习简介及其应用] 计算机眼中的状态与行为 (07:25) 2-1 [PPO算法与公式推导] 基本情况介绍 (11:17) 2-2 [PPO算法与公式推导] 与环境交互得到所需数据 (08:30) 2-3 [PPO算法与公式推导] 要完成的目标分析 (10:40) 2-4 [PPO算法与公式推导] 策略梯度推导 (09:01) 2-5 [PPO算法与公式推导] baseline方法 (06:10) 2-6 [PPO算法与公式推导] OnPolicy与OffPolicy策略 (07:44) 2-7 [PPO算法与公式推导] importance sampling的作用 (08:31) 2-8 [PPO算法与公式推导] PPO算法整体思路解析 (09:19) 3-1 [策略梯度实战-月球登陆器训练实例] Critic的作用与效果 (10:39) 3-2 [策略梯度实战-月球登陆器训练实例] PPO2版本公式解读 (11:45) 3-3 [策略梯度实战-月球登陆器训练实例] 参数与网络结构定义 (08:04) 3-4 [策略梯度实战-月球登陆器训练实例] 得到动作结果 (07:17) 3-5 [策略梯度实战-月球登陆器训练实例] 奖励获得与计算 (08:08) 3-6 [策略梯度实战-月球登陆器训练实例] 参数迭代与更新 (11:03) 4-1 [Q-learning算法] 算法原理通俗解读 (07:11) 4-2 [Q-learning算法] 目标函数与公式解析 (10:07) 4-3 [Q-learning算法] Qlearning算法实例解读 (07:45) 4-4 [Q-learning算法] Q值迭代求解 (08:59) 4-5 [Q-learning算法] DQN简介 (05:07) 5-1 [DQN算法实例演示] 整体任务流程演示 (05:21) 5-2 [DQN算法实例演示] 探索与action获取 (06:58) 5-3 [DQN算法实例演示] 计算target值 (05:17) 5-4 [DQN算法实例演示] 训练与更新 (08:12) 6-1 [DQN改进与应用技巧] DoubleDqn要解决的问题 (06:47) 6-2 [DQN改进与应用技巧] DuelingDqn改进方法 (06:26) 6-3 [DQN改进与应用技巧] Dueling整体网络架构分析 (08:27) 6-4 [DQN改进与应用技巧] MultiSetp策略 (03:45) 6-5 [DQN改进与应用技巧] 连续动作处理方法 (08:23) 7-1 [Actor-Critic算法分析(A3C)] AC算法回顾与知识点总结 (07:18) 7-2 [Actor-Critic算法分析(A3C)] 优势函数解读与分析 (07:12) 7-3 [Actor-Critic算法分析(A3C)] 计算流程实例 (05:50) 7-4 [Actor-Critic算法分析(A3C)] A3C整体架构分析 (06:01) 7-5 [Actor-Critic算法分析(A3C)] 损失函数整理 (08:32) 8-1 [A3C算法玩转超级马里奥] 整体流程与环境配置 (05:38) 8-2 [A3C算法玩转超级马里奥] 启动游戏环境 (06:59) 8-3 [A3C算法玩转超级马里奥] 初始化局部模型并加载参数 (08:05) 8-4 [A3C算法玩转超级马里奥] 要计算的指标回顾 (09:01) 8-5 [A3C算法玩转超级马里奥] 与环境交互得到训练数据 (09:31) 8-6 [A3C算法玩转超级马里奥] 训练网络模型 (09:39) 9-1 [算法补充-卷积神经网络原理与参数解读] 卷积神经网络应用领域 (07:24) 9-2 [算法补充-卷积神经网络原理与参数解读] 卷积的作用 (09:23) 9-3 [算法补充-卷积神经网络原理与参数解读] 卷积特征值计算方法 (08:07) 9-4 [算法补充-卷积神经网络原理与参数解读] 得到特征图表示 (06:58) 9-5 [算法补充-卷积神经网络原理与参数解读] 步长与卷积核大小对结果的影响 (08:11) 9-6 [算法补充-卷积神经网络原理与参数解读] 边缘填充方法 (06:30) 9-7 [算法补充-卷积神经网络原理与参数解读] 特征图尺寸计算与参数共享 (07:02) 9-8 [算法补充-卷积神经网络原理与参数解读] 池化层的作用 (05:38) 9-9 [算法补充-卷积神经网络原理与参数解读] 整体网络架构 (06:20) 9-10 [算法补充-卷积神经网络原理与参数解读] VGG网络架构 (06:16) 9-11 [算法补充-卷积神经网络原理与参数解读] 残差网络Resnet (07:41) 9-12 [算法补充-卷积神经网络原理与参数解读] 感受野的作用 (05:46) 10-1 [基础补充-PyTorch框架基本处理操作] PyTorch框架发展趋势简介 (08:25) 10-2 [基础补充-PyTorch框架基本处理操作] 框架安装方法(CPU与GPU版本) (05:13) 10-3 [基础补充-PyTorch框架基本处理操作] PyTorch基本操作简介 (09:25) 10-4 [基础补充-PyTorch框架基本处理操作] 自动求导机制 (10:59) 10-5 [基础补充-PyTorch框架基本处理操作] 线性回归DEMO-数据与参数配置 (08:56) 10-6 [基础补充-PyTorch框架基本处理操作] 线性回归DEMO-训练回归模型 (10:08) 10-7 [基础补充-PyTorch框架基本处理操作] 常见tensor格式 (07:10) 10-8 [基础补充-PyTorch框架基本处理操作] Hub模块简介 (08:25) 11-1 [基础补充-PyTorch图像识别实例] 卷积网络参数定义 (07:21) 11-2 [基础补充-PyTorch图像识别实例] 网络流程解读 (07:26) 11-3 [基础补充-PyTorch图像识别实例] Vision模块功能解读 (05:10) 11-4 [基础补充-PyTorch图像识别实例] 分类任务数据集定义与配置 (06:27) 11-5 [基础补充-PyTorch图像识别实例] 图像增强的作用 (04:51) 11-6 [基础补充-PyTorch图像识别实例] 数据预处理与数据增强模块 (09:25) 11-7 [基础补充-PyTorch图像识别实例] Batch数据制作 (08:37) 11-8 [基础补充-PyTorch图像识别实例] 迁移学习的目标 (05:31) 11-9 [基础补充-PyTorch图像识别实例] 迁移学习策略 (07:11) 11-10 [基础补充-PyTorch图像识别实例] 加载训练好的网络模型 (09:54) 11-11 [基础补充-PyTorch图像识别实例] 优化器模块配置 (05:14) 11-12 [基础补充-PyTorch图像识别实例] 实现训练模块 (08:15) 11-13 [基础补充-PyTorch图像识别实例] 训练结果与模型保存 (09:31) 11-14 [基础补充-PyTorch图像识别实例] 加载模型对测试数据进行预测 (09:10) 11-15 [基础补充-PyTorch图像识别实例] 额外补充-Resnet论文解读 (11:47) 11-16 [基础补充-PyTorch图像识别实例] 额外补充-Resnet网络架构解读 (08:26)






