课程目录
1-1 [课程答疑 QQ 群:574185645] 老汤大数据课程体系介绍 (06:21) 2-1 [网站流量离线分析项目] 网站分析概述 (22:20) 2-2 [网站流量离线分析项目] 基本术语 (15:14) 2-3 [网站流量离线分析项目] 维度和指标 (09:24) 2-4 [网站流量离线分析项目] 功能模块讲解一 (25:39) 2-5 [网站流量离线分析项目] 功能模块讲解二 (10:23) 2-6 [网站流量离线分析项目] 功能模块讲解三(事件追踪) (09:42) 2-7 [网站流量离线分析项目] 功能模块讲解四(转化分析) (15:57) 2-8 [网站流量离线分析项目] 功能模块讲解四(访客分析) (03:05) 2-9 [网站流量离线分析项目] 功能模块讲解五(广告效果) (14:10) 2-10 [网站流量离线分析项目] 数据收集技术 (10:34) 2-11 [网站流量离线分析项目] 网站分析中的Cookie (08:31) 2-12 [网站流量离线分析项目] 收集到的数据的格式 (16:44) 2-13 [网站流量离线分析项目] 收集到的数据 (24:09) 2-14 [网站流量离线分析项目] 数据准备 (16:31) 2-15 [网站流量离线分析项目] 实体表的设计 (13:42) 2-16 [网站流量离线分析项目] 会话(session)表 (14:46) 2-17 [网站流量离线分析项目] 最终模型 (07:43) 2-18 [网站流量离线分析项目] 项目总体结构 (09:08) 2-19 [网站流量离线分析项目] 在github上搭建项目结构目录 (25:51) 2-20 [网站流量离线分析项目] 原始预解析逻辑的实现 (22:54) 2-21 [网站流量离线分析项目] 原始预解析后入Hive数据库 (29:19) 2-22 [网站流量离线分析项目] URL的解析 (42:59) 2-23 [网站流量离线分析项目] ColumnReader的实现 (06:04) 2-24 [网站流量离线分析项目] 日志解析结构设计 (19:12) 2-25 [网站流量离线分析项目] MouseClick日志的解析 (20:27) 2-26 [网站流量离线分析项目] IPLocation Parser (24:41) 2-27 [网站流量离线分析项目] Heartbeat和Event日志的解析 (11:15) 2-28 [网站流量离线分析项目] PageView日志的解析 (16:32) 2-29 [网站流量离线分析项目] StringMatcher的实现 (11:09) 2-30 [网站流量离线分析项目] 搜索引擎和关键词的解析 (30:54) 2-31 [网站流量离线分析项目] 来源类型和来源渠道的解析 (09:06) 2-32 [网站流量离线分析项目] MongoDB配置目标页面 (30:06) 2-33 [网站流量离线分析项目] TargetPage的解析 (26:33) 2-34 [网站流量离线分析项目] TargetPageDataObject的解析 (20:01) 2-35 [网站流量离线分析项目] LogParser对外提供的服务 (11:13) 2-36 [网站流量离线分析项目] WebLog-Parser需要计算的几个重要字段 (18:51) 2-37 [网站流量离线分析项目] 页面停留时长的表达 (02:45) 2-38 [网站流量离线分析项目] avro的Schema的定义 (15:24) 2-39 [网站流量离线分析项目] Spark ETL依赖的jar包 (01:54) 2-40 [网站流量离线分析项目] Spark离线分析的流程 (30:56) 2-41 [网站流量离线分析项目] PartitionProcessor实现 (23:28) 2-42 [网站流量离线分析项目] 会话切割逻辑实现 (32:57) 2-43 [网站流量离线分析项目] 会话聚合计算逻辑 (15:10) 2-44 [网站流量离线分析项目] Session字段的解析 (36:05) 2-45 [网站流量离线分析项目] PageView字段的解析计算 (12:14) 2-46 [网站流量离线分析项目] 其他实体字段的解析计算 (11:20) 2-47 [网站流量离线分析项目] 将实体以avro的格式写到HDFS中 (11:20) 2-48 [网站流量离线分析项目] 单元测试和集成测试以及结果验证 (42:22) 2-49 [网站流量离线分析项目] 数据导入到最终的模型数据库中 (18:11) 2-50 [网站流量离线分析项目] user访问信息维度计算一 (32:49) 2-51 [网站流量离线分析项目] user访问信息维度计算二 (27:08) 2-52 [网站流量离线分析项目] 数据重跑逻辑 (32:32) 2-53 [网站流量离线分析项目] 数据倾斜问题的解决 (09:01) 2-54 [网站流量离线分析项目] 在服务器上跑网站流量离线分析的jobs (38:39) 2-55 [网站流量离线分析项目] SQL分析网站流量的情况 (30:33) 2-56 [网站流量离线分析项目] 真实环境数据量和配置 (05:48) 2-57 [网站流量离线分析项目] 真实数据量和配置(二) (07:09) 2-58 [网站流量离线分析项目] 网站流量离线分析团队组合 (09:36) 3-1 [网站流量实时分析项目] 需求说明一 (16:07) 3-2 [网站流量实时分析项目] 需求说明二 (33:41) 3-3 [网站流量实时分析项目] 项目总体架构(数据流) (10:33) 3-4 [网站流量实时分析项目] Spark Streaming读取Kafka中的数据 (21:54) 3-5 [网站流量实时分析项目] 每一个批次的**的会话信息的计算 (28:46) 3-6 [网站流量实时分析项目] 会话相关指标的计算 (12:17) 3-7 [网站流量实时分析项目] 保存会话相关指标到HBase中 (16:36) 3-8 [网站流量实时分析项目] 三个版本的Spark On HBase的使用 (13:22) 3-9 [网站流量实时分析项目] 本地测试的环境和数据的准备 (14:21) 3-10 [网站流量实时分析项目] Spark Streaming程序测试 (13:19) 3-11 [网站流量实时分析项目] Hive查询HBase中会话相关的数据. (08:58) 3-12 [网站流量实时分析项目] mapWithState计算会话的状态 (16:58) 3-13 [网站流量实时分析项目] 优雅的停止Spark Streaming程序 (12:36) 3-14 [网站流量实时分析项目] Driver端checkpoint机制保证不丢失数据 (17:27) 3-15 [网站流量实时分析项目] 自己控制消费Kafka的offsets信息 (16:33) 3-16 [网站流量实时分析项目] zero data loss (32:25) 3-17 [网站流量实时分析项目] 在yarn上跑实时计算的应用 (46:45) 3-18 [网站流量实时分析项目] 项目结果的演示 (12:16) 3-19 [网站流量实时分析项目] 压测并且检测Spark Streaming程序 (07:52) 3-20 [网站流量实时分析项目] 生产上Spark-submit配置需要注意的点 (08:57) 3-21 [网站流量实时分析项目] 实时流处理项目的数据流 (04:15)





