在数字化转型浪潮中,数据被视为核心资产,而爬虫技术则是获取这些数据的关键工具。《Python爬虫实战》作为一门体系课程,旨在帮助学习者从零开始构建完整的爬虫知识体系,并掌握实际场景中的核心技能。无论你是初学者还是希望提升实战能力的开发者,本课程都将为你提供系统化的学习路径。

课程从基础概念入手,首先厘清爬虫的本质与价值。你不仅会了解如何抓取网页数据,还会深入探讨爬虫的合法性边界。这部分内容至关重要,因为它帮助学习者建立正确的职业道德与法律意识,避免在技术实践中触碰红线。接着,通过“爬虫初始深入”章节,你将理解网络请求的基本逻辑,并系统掌握 HTTP 与 HTTPS 协议的原理,为后续编写稳健的爬虫程序奠定理论基础。

核心模块聚焦于 Python 中广泛使用的 requests 库。我们将通过“requests 一血”带领大家迈出实战第一步,随后通过多个典型案例层层递进:从简易网页采集器的搭建,到破解百度翻译接口的逆向分析,再到豆瓣电影数据的精细化爬取。每个案例都经过精心设计,旨在让你在面对不同的反爬策略和数据结构时,学会灵活运用 headers 伪造、参数解析、异常处理等关键技能。课程还特别设置了作业环节,要求学员独立完成实践任务,这种“学以致用”的设计理念能有效避免理论学习与实际应用脱节的问题。

学习门槛适中,只需具备 Python 基础语法知识即可入门。随着课程的推进,你将逐步深入更复杂的场景,如动态页面解析和接口逆向工程。课程资料包可作为辅助工具,帮助你在课后复习和实践时参考,但不建议直接依赖,而应结合课程讲解自己动手实现。

学完本课程后,你将具备独立开发中小型爬虫项目的能力,能够应对常规网站的静态及动态数据抓取需求。更重要的是,你将建立起规范的爬虫开发思维,懂得在技术探索与合规使用之间找到平衡点。无论你的目标是从事数据分析、竞品监控,还是个人兴趣驱动的信息聚合,这门课都将是你通向自动化数据采集之路的坚实基石。别让繁琐的手动复制成为工作中的负担,让 Python 爬虫成为你提升效率的秘密武器。

课程目录

1-1 [爬虫基础简介] 爬虫简介-爬虫的概念和价值 (09:12)
1-2 [爬虫基础简介] 爬虫合法性探究 (09:30)
1-3 [爬虫基础简介] 爬虫初始深入 (18:35)
1-4 [爬虫基础简介] https://http&https协议 (23:45)
2-1 [requests模块] requests一血 (22:51)
2-2 [requests模块] requests巩固深入案例介绍 (03:59)
2-3 [requests模块] requests模块巩固深入案例之简易网页采集器 (22:23)
2-4 [requests模块] requests模块巩固深入案例之破解百度翻译 (24:01)
2-5 [requests模块] requests模块巩固深入案例之豆瓣电影 (13:06)
2-6 [requests模块] 作业 (06:02)
2-7 [requests模块] 综合练习之药监总局01 (13:10)
2-8 [requests模块] 综合练习之药监总局02 (13:36)
2-9 [requests模块] 综合练习之药监总局03screenflow (21:25)
2-10 [requests模块] 综合练习之药监总局04screenflow (04:03)
2-11 [requests模块] 总结回顾 (03:42)
3-1 [数据解析] 数据解析概述 (11:48)
3-2 [数据解析] 图片数据爬取 (06:47)
3-3 [数据解析] 正则解析案例01 (22:38)
3-4 [数据解析] 正则解析案例02 (09:18)
3-5 [数据解析] bs4解析概述 (12:50)
3-6 [数据解析] bs4解析具体使用讲解 (25:56)
3-7 [数据解析] bs4解析案例实战 (19:09)
3-8 [数据解析] xpath解析基础01 (08:11)
3-9 [数据解析] xpath解析基础02 (28:24)
3-10 [数据解析] xpath实战-58二手房 (17:39)
3-11 [数据解析] xpath解析案例-4k图片解析下载 (19:17)
3-12 [数据解析] xpath解析案例-全国城市名称爬取 (16:22)
3-13 [数据解析] xpath作业 (03:31)
4-1 [验证码识别] 验证码识别简介 (07:45)
4-2 [验证码识别] 云打码使用流程 (22:10)
4-3 [验证码识别] 古诗文网验证码识别 (19:25)
5-1 [requests模块高级操作] 模拟登录实现流程梳理 (13:10)
5-2 [requests模块高级操作] 人人网模拟登录01 (06:53)
5-3 [requests模块高级操作] 人人网模拟登录02 (08:51)
5-4 [requests模块高级操作] 模拟登录cookie操作01 (06:53)
5-5 [requests模块高级操作] 模拟登录cookie操作02 (22:58)
5-6 [requests模块高级操作] 代理理论讲解 (07:34)
5-7 [requests模块高级操作] 代理在爬虫中的应用 (12:05)
6-1 [高性能异步爬虫] 异步爬虫概述 (09:45)
6-2 [高性能异步爬虫] 异步爬虫之多进程and多线程 (05:55)
6-3 [高性能异步爬虫] 异步爬虫之线程池and进程池概述 (02:33)
6-4 [高性能异步爬虫] 异步爬虫之线程池的基本使用 (09:20)
6-5 [高性能异步爬虫] 异步爬虫之线程池案例应用 (30:35)
6-6 [高性能异步爬虫] 协程相关概念回顾 (04:57)
6-7 [高性能异步爬虫] 协程相关操作回顾 (18:46)
6-8 [高性能异步爬虫] 多任务异步协程实现 (11:39)
6-9 [高性能异步爬虫] aiohttp模块引出 (10:08)
6-10 [高性能异步爬虫] aiohttp+多任务异步协程实现异步爬虫 (10:54)
7-1 [selenium模块应用] selenium简介 (11:45)
7-2 [selenium模块应用] seleniun初试 (16:34)
7-3 [selenium模块应用] selenium其他自动化操作 (15:07)
7-4 [selenium模块应用] iframe处理+动作链 (17:18)
7-5 [selenium模块应用] selenium的模拟登陆 (07:21)
7-6 [selenium模块应用] 无头浏览器+规避检测 (09:58)
7-7 [selenium模块应用] 超级鹰的基本使用 (17:46)
7-8 [selenium模块应用] 12306模拟登录01 (27:08)
7-9 [selenium模块应用] 12306模拟登录02 (14:00)
8-1 [scrapy框架] scrapy框架初识 (06:21)
8-2 [scrapy框架] scrapy环境安装 (07:28)
8-3 [scrapy框架] scrapy基本使用 (24:59)
8-4 [scrapy框架] scrapy数据解析操作 (20:20)
8-5 [scrapy框架] 基于终端指令的持久化存储 (09:14)
8-6 [scrapy框架] 基于管道持久化存储操作01 (29:18)
8-7 [scrapy框架] 基于管道持久化存储操作02 (17:10)
8-8 [scrapy框架] 全站数据爬取 (23:31)
8-9 [scrapy框架] 五大核心组件 (13:39)
8-10 [scrapy框架] 请求传参01 (20:18)
8-11 [scrapy框架] 请求传参02 (05:06)
8-12 [scrapy框架] scrapy图片爬取01 (21:17)
8-13 [scrapy框架] scrapy图片爬取02 (10:36)
8-14 [scrapy框架] 中间件初始 (12:23)
8-15 [scrapy框架] 中间件-处理请求 (20:40)
9-1 [增量式爬虫] 网易新闻01-01 (07:56)
9-2 [增量式爬虫] 网易新闻02 (09:54)
9-3 [增量式爬虫] 网易新闻03 (15:16)
9-4 [增量式爬虫] 网易新闻04 (20:33)
9-5 [增量式爬虫] CrawlSpider的全站数据爬取01 (26:36)
9-6 [增量式爬虫] CrawlSpider的全站数据爬取02 (09:45)
9-7 [增量式爬虫] CrawlSpider的全站数据爬取03 (32:04)
9-8 [增量式爬虫] 分布式概述 (17:01)
9-9 [增量式爬虫] 分布式搭建 (33:23)
9-10 [增量式爬虫] 增量式爬虫 (26:59)