这门课在补齐什么能力缺口

很多大数据开发工程师停留在“会写 SQL、会调 Spark 接口”的层面,一旦离开运维提供的现成脚手架,就无法独立完成从数据采集到算法落地的全链路闭环。本课程正是针对这一断层而设。它不教零散的语法,而是以图书电商场景为切入点,串联起 Flume 多级高可用日志采集、HBase 特征向量存储、Spark 离线处理与 Storm 实时计算四大核心环节,最终完成一个具备推荐功能的完整系统。你将直面企业级架构中的真实痛点:如何实现日志的高可用收集?如何将稀疏的行为数据转化为模型可用的特征向量?如何在离线批处理与实时流处理之间切换,保证推荐结果的时效性与准确性?课程结合算法原理,让你不只是调用 API,而是理解背后的数据流转逻辑和工程权衡。

适合什么基础、建议先看哪几块

适合已掌握 Hadoop 生态基本操作、熟悉 Java/Scala 编程、了解 Spark 和 Storm 基础用法的开发者。如果你尚不熟悉 HBase 的二维表模型与 RowKey 设计,或不清楚推荐算法中协同过滤、特征工程的具体实现细节,这门课能帮你打通最后一段路。建议先重点研读日志收集与 HBase 存储部分,这是整个系统的基石——Flume 的多级高可用配置决定了数据不丢,HBase 的特征向量组织方式决定了后续算法的效率。接着深入 Spark 离线推荐模块,理解批量计算如何训练模型;最后再看 Storm 实时推荐,体会流式计算如何处理用户即时行为。配套练习需结合资料包中的代码框架,手动调整参数、观察推荐结果变化,而非直接运行默认脚本。只有亲手调试过特征提取与模型评分流程,才能真正掌握这套技术栈的工程落地能力。

学完能独立做什么

完成本课程后,你将能够独立设计和搭建基于用户行为的个性化推荐系统原型。你可以从零开始,用 Flume 构建稳定的日志采集管道,用 HBase 高效存储和检索用户画像与物品特征,用 Spark 实现离线的召回与排序模型,用 Storm 支持实时的兴趣更新。更重要的是,你能够根据业务需求(如图书电商、内容平台等)灵活调整各组件配置,排查数据不一致或延迟过高等常见问题。配套资料包中的案例代码可作为起点,但你需独立完成至少一次从日志埋点到推荐结果输出的全流程开发,才能真正内化这些技能。建议边学边做,每完成一个模块就进行小范围测试,确保数据链路畅通后再推进下一阶段。

课程介绍

课程结合算法原理,利用Spark 2.x 和主流技术栈,通过Flume多级高可用日志收集用户行为,使用HBase特征向量存储,利用算法原理结合Spark和Storm进行离线和实时推荐,实现图书电商场景下的个性化推荐系统 聚焦算法原理,搭建企业级系统,给大数据开发工程师的刚需课

课程目录

课程结合算法原理,利用Spark 2.x 和主流技术栈,通过Flume多级高可用日志收集用户行为,使用HBase特征向量存储,利用算法原理结合Spark和Storm进行离线和实时推荐,实现图书电商场景下的个性化推荐系统 聚焦算法原理,搭建企业级系统,给大数据开发工程师的刚需课