从单库瓶颈到分布式架构:这门课解决什么核心痛点?
很多开发者在面对单机数据库性能瓶颈时,往往陷入“加配置”或“简单分库分表”的思维定势,却对底层的分布式原理一知半解。当数据量呈指数级增长,传统的行式存储和高并发写入成为瓶颈时,如何构建高可用、高并发的分布式数据系统?本课程直击这一技术断层,旨在填补开发者在分布式存储内核与海量数据场景设计之间的能力缺口。它不只是介绍HBase或StarRocks如何使用,而是深入剖析列式存储、LSM树、MVCC机制以及分区行键设计的底层逻辑,帮助学习者建立从存储引擎到上层应用的完整知识闭环。
基础篇夯实内核,案例篇贯通实战
课程结构清晰,分为基础篇与案例篇两部分,建议按顺序学习。基础篇重点攻克四大核心难题:首先厘清列式存储相较于行式存储的适用边界及优化手段;其次深入解析LSM树数据结构如何平衡读写性能;再次探讨编码压缩在节省存储与提升IO效率中的作用;最后剖析分布式环境下事务、MVCC的实现差异,以及分区设计与行键规划对Join操作性能的决定性影响。这部分内容偏硬核,需要结合笔记反复消化。
案例篇则通过两个典型场景将理论落地。第一个场景是“手机云服务数据存储”,以HBase为载体,讲解其底层数据组织方式、随机存取原理,并挑战读者在不支持二级索引的情况下自行实现索引方案,最终完成一套完整的数据存储设计。第二个场景聚焦“客户数据平台(CDP)”,引入StarRocks引擎,探讨其如何应对高吞吐的存储与计算需求,以及如何根据业务特征选择合适的表存储类型。这种从理论到具体产品实现的过渡,有助于学习者理解不同分布式数据库的定位差异。
学完能做什么?如何高效配合资料练习?
完成本课程后,你将能够独立评估海量数据场景下的存储选型,掌握HBase和StarRocks等主流分布式数据库的核心调优技巧,并能针对实际业务需求设计出合理的分区策略与行键模型。为了达到最佳学习效果,建议配合课程资料中的示例代码进行动手实践,特别是在案例篇中,务必亲自编写基于HBase的数据存储设计方案,尝试模拟二级索引的实现逻辑。不要仅停留在阅读层面,只有通过手写代码和调试配置,才能真正内化分布式存储的那些“坑”与“巧”。此外,建议在学习每个技术点时,对比传统关系型数据库的差异,制作一张对比表格,这将是面试与实战中快速回忆知识点的最佳工具。
课程目录
开篇词 (1讲)
- 开篇词|玩转数据库,让数据尽在你的掌控
基础篇 (6讲)
- 01|列式存储已经取代行式存储了吗?
- 02|分布式存储数据结构LSM,如何优化读写性能?
- 03|编码和压缩有什么用?
- 04|数据库都需要事务和MVCC吗?
- 05|分布式数据库如何合理分区与设计行键?
- 06|数据分区后,如何应对Join?
案例篇 (14讲)
- 07|从一个手机云服务数据存储的需求开始
- 08|HBase如何组织与存储数据?
- 09|为什么HBase能够实现海量数据的实时随机存取?
- 10|不支持二级索引,如何自己实现一个?
- 11|实现:基于HBase的手机云服务数据存储设计
- 12|还有哪些调优可以提升性能?
- 13|客户数据平台(CDP)的存储与计算需求
- 14|技术上,StarRocks如何应对CDP需求?
- 15|数据存储上如何选用合适的表存储类型?
- 16|性能上如何优化数据查询?
- 17|ClickHouse为什么会给人极致速度的印象?
- 18|ClickHouse应该如何选用表引擎?
- 19|如何在ClickHouse利用集群能力实现并行计算?
- 20|如何用ClickHouse bitmap加速人群计算
AI 与向量数据库 (6讲)
- 21|向量数据库:图片、音频、文本等非结构化数据的搜索需求是怎么实现的?
- 22|Faiss是一个向量数据库吗?
- 23|案例:带你用Faiss手撸一个人脸识别系统
- 24|带你看一个完整的向量数据库Milvus
- 25|案例:RAG+Milvus+大模型,搭建个人知识库
- 26|向量数据库,十字路口向左还是向右?
结束语 (2讲)
- 结束语|不让技术成为自我目的
- 结课测试|来赴一场满分之约





