解决什么问题:用“试错”思维破解迷宫导航难题
很多初学者在面对强化学习时,容易陷入“死记硬背公式”的误区。本课程聚焦于强化学习中最经典的入门算法——Q-Learning(Q学习),通过一个极具象化的场景:沙鼠走迷宫,将抽象的数学概念具象化。课程不堆砌复杂的推导,而是直接带你从最基础的马尔可夫链和马尔可夫决策过程(MDP)入手,一步步搭建起智能体(Agent)在环境中“感知—决策—行动—反馈”的完整闭环。你将学会如何让程序像沙鼠一样,通过不断的试错和记忆,在未知环境中找到最优路径,彻底搞懂“探索”与“利用”之间的权衡。
适合什么基础:数学门槛低,重在逻辑构建
这门课非常适合基础薄弱、想快速上手 AI 算法的同学。你不需要深厚的微积分或线性代数背景,只要具备基本的编程逻辑思维(如 Python 环境搭建和变量控制)即可。建议在开始前,先快速浏览一下“马尔可夫链”和“马尔可夫决策过程”这两个章节,建立环境的状态和奖励模型概念。如果对 Python 的数据结构(如字典、列表)不太熟悉,可以先做简单的语法复习。课程从零开始,没有隐藏的代码坑,适合用来作为从“理论”跨向“实战”的第一块敲门砖。
学完能独立做什么:手写一个可运行的迷宫寻路程序
学完本课程,你不再只能看懂 Q-Learning 的原理图,而是能独立编写并运行一个完整的迷宫寻路程序。你应该能够清晰地回答:如何定义环境的状态空间?如何设定奖励函数来引导沙鼠避开死路?如何通过 Q 表(Q-Table)来存储和更新策略?最终,你将获得一个能够自动在迷宫中穿梭并找到出口的智能体,并能根据不同的迷宫结构(如增加障碍物、改变出口位置)调整参数,观察算法的学习收敛过程。
资料怎么配合练习:代码与图解结合,重在复现
资料包中包含了从算法推导到代码实现的完整链条。建议的学习路径是:先观看“马尔可夫决策过程”建立数学模型,再重点精读“Q-Learning算法”部分理解核心逻辑。在“迷宫实战”章节中,不要只看视频,务必对照资料中的代码逐行调试,尝试修改迷宫的地图参数或奖励机制(例如给中间障碍物设置负分),观察沙鼠的行为变化。通过修改代码并复现视频中的效果,才是真正掌握这一算法的关键。
课程目录
1 第1课:沙鼠走迷宫 (06:20) 2 第2课 马尔可夫链 (09:12) 3 第3课 马尔可夫决策过程 (02:30) 4 第4课 Q-Learning算法 (16:52) 5 第5课 迷宫实战 (11:00)





