填补聚类算法的认知与实操断层
这门课直击初学者在掌握基础统计后,面对高维数据“无监督”处理时的无力感。很多学习者知道“要把相似的东西归为一类”,但一动手就卡壳:距离怎么算才公平?K 值怎么定?聚类结果好不好验证?课程从聚类概述及距离度量讲起,先把“相似性”的数学定义(如欧氏距离、曼哈顿距离)和算法分类讲透,避免后续盲目调参。适合已熟悉 R 语言基本语法、了解线性回归等监督学习基础,但缺乏无监督学习实操经验的人。不建议零 R 基础者直接上手,否则会在代码报错上消耗过多精力。建议先看第 1 章,吃透距离度量对结果的影响,这是所有聚类算法的底层逻辑;紧接着跳看第 3 章 K-means 的核心原理与实现,建立对“质心迭代”的直观理解。
从原理到可视化的闭环练习
学完这节,你应能独立回答:什么场景该用层次聚类而非 K-means?如何通过树形图(Dendrogram)直观判断截断点?K-中心点聚类相比 K-means 解决了什么噪声敏感性问题?课程后半部分覆盖了层次聚类、K-means、K-中心点及密度聚类(DBSCAN 类思想)四大流派,并专门花费近 50 分钟讲解利用 `factoextra` 和 `dendextend` 包进行树形图可视化与对比。这部分极易被忽略,却是向业务方汇报聚类效果的关键。学完能独立使用 R 语言对非结构化或半结构化数据进行特征聚类,并输出带注释的可视化图表用于解释分类依据。资料包中的案例代码是核心练习素材,不要只看不练。
配套练习与评估验证策略
练习时,建议放弃纯随机数据,去 Kaggle 或本地 CSV 中寻找带明确标签的数据集(如鸢尾花、客户消费记录),先故意不用标签跑一遍 K-means 和层次聚类,再用标签计算调整兰德指数(ARI)或轮廓系数进行验证。第 6 章“集群评估及验证”必须结合前 5 章的代码反复调试,重点理解“簇内方差最小”与“簇间距离最大”之间的权衡。若树形图难以阅读,务必按第 2 章方法用 `dendextend` 调整分支角度与颜色,将枯燥的 R 默认图变成可演示的交互图。最后,尝试用密度聚类处理含大量离群点的数据,对比其与 K-means 结果的差异,记录参数 `eps` 和 `minPts` 变化对结果的影响。这套流程走完,才算真正具备独立处理探索性数据分析的能力,而非只会调用库函数。
课程目录
1-1 [聚类概述及距离度量] 聚类算法概述 (09:39) 1-2 [聚类概述及距离度量] 聚类距离度量方法及案例介 (18:51) 2-1 [层次聚类] 层次聚类算法原理及凝聚层次聚类和分裂层次聚类案例讲解 (22:56) 2-2 [层次聚类] 聚类树形图可视化-factoextra包详细讲解 (12:50) 2-3 [层次聚类] 聚类树形图可视化-利用dendextend包调整树形图可视化 (21:33) 2-4 [层次聚类] 利用dendextend包对不同树形图进行比较 (17:13) 3-1 [K-均值聚类] K-means聚类算法原理及案例实现详解 (23:44) 4-1 [K-中心点聚类] K-中心点聚类算法原理及案例详 (17:46) 5-1 [密度聚类] 密度聚类原理及R语言实现案例详解 (25:46) 6-1 [集群评估] 集群评估及验证讲解 (22:20)





