在数字化转型浪潮中,数据被视为核心资产,而爬虫技术则是获取这些数据的关键工具。《Python爬虫实战》作为一门体系课程,旨在帮助学习者从零开始构建完整的爬虫知识体系,并掌握实际场景中的核心技能。无论你是初学者还是希望提升实战能力的开发者,本课程都将为你提供系统化的学习路径。
课程从基础概念入手,首先厘清爬虫的本质与价值。你不仅会了解如何抓取网页数据,还会深入探讨爬虫的合法性边界。这部分内容至关重要,因为它帮助学习者建立正确的职业道德与法律意识,避免在技术实践中触碰红线。接着,通过“爬虫初始深入”章节,你将理解网络请求的基本逻辑,并系统掌握 HTTP 与 HTTPS 协议的原理,为后续编写稳健的爬虫程序奠定理论基础。
核心模块聚焦于 Python 中广泛使用的 requests 库。我们将通过“requests 一血”带领大家迈出实战第一步,随后通过多个典型案例层层递进:从简易网页采集器的搭建,到破解百度翻译接口的逆向分析,再到豆瓣电影数据的精细化爬取。每个案例都经过精心设计,旨在让你在面对不同的反爬策略和数据结构时,学会灵活运用 headers 伪造、参数解析、异常处理等关键技能。课程还特别设置了作业环节,要求学员独立完成实践任务,这种“学以致用”的设计理念能有效避免理论学习与实际应用脱节的问题。
学习门槛适中,只需具备 Python 基础语法知识即可入门。随着课程的推进,你将逐步深入更复杂的场景,如动态页面解析和接口逆向工程。课程资料包可作为辅助工具,帮助你在课后复习和实践时参考,但不建议直接依赖,而应结合课程讲解自己动手实现。
学完本课程后,你将具备独立开发中小型爬虫项目的能力,能够应对常规网站的静态及动态数据抓取需求。更重要的是,你将建立起规范的爬虫开发思维,懂得在技术探索与合规使用之间找到平衡点。无论你的目标是从事数据分析、竞品监控,还是个人兴趣驱动的信息聚合,这门课都将是你通向自动化数据采集之路的坚实基石。别让繁琐的手动复制成为工作中的负担,让 Python 爬虫成为你提升效率的秘密武器。
课程目录
1-1 [爬虫基础简介] 爬虫简介-爬虫的概念和价值 (09:12) 1-2 [爬虫基础简介] 爬虫合法性探究 (09:30) 1-3 [爬虫基础简介] 爬虫初始深入 (18:35) 1-4 [爬虫基础简介] https://http&https协议 (23:45) 2-1 [requests模块] requests一血 (22:51) 2-2 [requests模块] requests巩固深入案例介绍 (03:59) 2-3 [requests模块] requests模块巩固深入案例之简易网页采集器 (22:23) 2-4 [requests模块] requests模块巩固深入案例之破解百度翻译 (24:01) 2-5 [requests模块] requests模块巩固深入案例之豆瓣电影 (13:06) 2-6 [requests模块] 作业 (06:02) 2-7 [requests模块] 综合练习之药监总局01 (13:10) 2-8 [requests模块] 综合练习之药监总局02 (13:36) 2-9 [requests模块] 综合练习之药监总局03screenflow (21:25) 2-10 [requests模块] 综合练习之药监总局04screenflow (04:03) 2-11 [requests模块] 总结回顾 (03:42) 3-1 [数据解析] 数据解析概述 (11:48) 3-2 [数据解析] 图片数据爬取 (06:47) 3-3 [数据解析] 正则解析案例01 (22:38) 3-4 [数据解析] 正则解析案例02 (09:18) 3-5 [数据解析] bs4解析概述 (12:50) 3-6 [数据解析] bs4解析具体使用讲解 (25:56) 3-7 [数据解析] bs4解析案例实战 (19:09) 3-8 [数据解析] xpath解析基础01 (08:11) 3-9 [数据解析] xpath解析基础02 (28:24) 3-10 [数据解析] xpath实战-58二手房 (17:39) 3-11 [数据解析] xpath解析案例-4k图片解析下载 (19:17) 3-12 [数据解析] xpath解析案例-全国城市名称爬取 (16:22) 3-13 [数据解析] xpath作业 (03:31) 4-1 [验证码识别] 验证码识别简介 (07:45) 4-2 [验证码识别] 云打码使用流程 (22:10) 4-3 [验证码识别] 古诗文网验证码识别 (19:25) 5-1 [requests模块高级操作] 模拟登录实现流程梳理 (13:10) 5-2 [requests模块高级操作] 人人网模拟登录01 (06:53) 5-3 [requests模块高级操作] 人人网模拟登录02 (08:51) 5-4 [requests模块高级操作] 模拟登录cookie操作01 (06:53) 5-5 [requests模块高级操作] 模拟登录cookie操作02 (22:58) 5-6 [requests模块高级操作] 代理理论讲解 (07:34) 5-7 [requests模块高级操作] 代理在爬虫中的应用 (12:05) 6-1 [高性能异步爬虫] 异步爬虫概述 (09:45) 6-2 [高性能异步爬虫] 异步爬虫之多进程and多线程 (05:55) 6-3 [高性能异步爬虫] 异步爬虫之线程池and进程池概述 (02:33) 6-4 [高性能异步爬虫] 异步爬虫之线程池的基本使用 (09:20) 6-5 [高性能异步爬虫] 异步爬虫之线程池案例应用 (30:35) 6-6 [高性能异步爬虫] 协程相关概念回顾 (04:57) 6-7 [高性能异步爬虫] 协程相关操作回顾 (18:46) 6-8 [高性能异步爬虫] 多任务异步协程实现 (11:39) 6-9 [高性能异步爬虫] aiohttp模块引出 (10:08) 6-10 [高性能异步爬虫] aiohttp+多任务异步协程实现异步爬虫 (10:54) 7-1 [selenium模块应用] selenium简介 (11:45) 7-2 [selenium模块应用] seleniun初试 (16:34) 7-3 [selenium模块应用] selenium其他自动化操作 (15:07) 7-4 [selenium模块应用] iframe处理+动作链 (17:18) 7-5 [selenium模块应用] selenium的模拟登陆 (07:21) 7-6 [selenium模块应用] 无头浏览器+规避检测 (09:58) 7-7 [selenium模块应用] 超级鹰的基本使用 (17:46) 7-8 [selenium模块应用] 12306模拟登录01 (27:08) 7-9 [selenium模块应用] 12306模拟登录02 (14:00) 8-1 [scrapy框架] scrapy框架初识 (06:21) 8-2 [scrapy框架] scrapy环境安装 (07:28) 8-3 [scrapy框架] scrapy基本使用 (24:59) 8-4 [scrapy框架] scrapy数据解析操作 (20:20) 8-5 [scrapy框架] 基于终端指令的持久化存储 (09:14) 8-6 [scrapy框架] 基于管道持久化存储操作01 (29:18) 8-7 [scrapy框架] 基于管道持久化存储操作02 (17:10) 8-8 [scrapy框架] 全站数据爬取 (23:31) 8-9 [scrapy框架] 五大核心组件 (13:39) 8-10 [scrapy框架] 请求传参01 (20:18) 8-11 [scrapy框架] 请求传参02 (05:06) 8-12 [scrapy框架] scrapy图片爬取01 (21:17) 8-13 [scrapy框架] scrapy图片爬取02 (10:36) 8-14 [scrapy框架] 中间件初始 (12:23) 8-15 [scrapy框架] 中间件-处理请求 (20:40) 9-1 [增量式爬虫] 网易新闻01-01 (07:56) 9-2 [增量式爬虫] 网易新闻02 (09:54) 9-3 [增量式爬虫] 网易新闻03 (15:16) 9-4 [增量式爬虫] 网易新闻04 (20:33) 9-5 [增量式爬虫] CrawlSpider的全站数据爬取01 (26:36) 9-6 [增量式爬虫] CrawlSpider的全站数据爬取02 (09:45) 9-7 [增量式爬虫] CrawlSpider的全站数据爬取03 (32:04) 9-8 [增量式爬虫] 分布式概述 (17:01) 9-9 [增量式爬虫] 分布式搭建 (33:23) 9-10 [增量式爬虫] 增量式爬虫 (26:59)




