scrapy-cookbook
0.2
每天15分钟玩转Scrapy01 - 架构全景与第一个爬虫
每天15分钟玩转Scrapy02 - Spider 与选择器
每天15分钟玩转Scrapy03 - 数据建模与落库
每天15分钟玩转Scrapy04 - 登录与Cookie
每天15分钟玩转Scrapy05 - 动态页面
每天15分钟玩转Scrapy06 - 媒体管道
每天15分钟玩转Scrapy07 - 反爬
每天15分钟玩转Scrapy08 - 性能调优
每天15分钟玩转Scrapy09 - 异步
每天15分钟玩转Scrapy10 - 工程化
每天15分钟玩转Scrapy11 - 部署与运维
联系我
scrapy-cookbook
Welcome to scrapy-cookbook
View page source
Welcome to scrapy-cookbook
¶
Contents:
每天15分钟玩转Scrapy01 - 架构全景与第一个爬虫
开场
Scrapy 是什么
跑通第一个爬虫
名言榜与作者统计
容易栽的跟头
小结
每天15分钟玩转Scrapy02 - Spider 与选择器
开场
Spider 是怎么跑起来的
CSS 选择器
XPath 与正则
把链接串成一张网
实战:把演示站抓个遍
容易栽的跟头
小结
每天15分钟玩转Scrapy03 - 数据建模与落库
开场
Item:给数据定个型
ItemLoader 与处理器:把清洗搬出 parse
管道:数据的最后一道工序
实战:抓名言、去重、落库
容易栽的跟头
小结
每天15分钟玩转Scrapy04 - 登录与Cookie
开场
Cookie 是怎么把会话记住的
模拟登录:三步走
HTTP 认证:两个入口
容易栽的跟头
小结
每天15分钟玩转Scrapy05 - 动态页面
开场
动态内容:先找数据源
交给浏览器渲染
让浏览器多干一点
容易栽的跟头
小结
每天15分钟玩转Scrapy06 - 媒体管道
开场
媒体管道的两个约定
现成管道与自定义扩展点
容易栽的跟头
小结
每天15分钟玩转Scrapy07 - 反爬
开场
别用默认 UA 自我介绍
请求头不止 User-Agent
被拦之后:重试与守规矩
走代理换出口
容易栽的跟头
小结
每天15分钟玩转Scrapy08 - 性能调优
开场
速度先量再调
并发到底能开多大
瓶颈常常不在网络
把请求省下来,把数据看清楚
容易栽的跟头
小结
每天15分钟玩转Scrapy09 - 异步
开场
asyncio 与 reactor 的边界
没有 reactor 也能跑
容易栽的跟头
小结
每天15分钟玩转Scrapy10 - 工程化
开场
从命令行到脚本
断点续爬与磁盘队列
契约测试
容易栽的跟头
小结
每天15分钟玩转Scrapy11 - 部署与运维
开场
上线与运维
用 scrapyd 把爬虫变成服务
容易栽的跟头
小结
联系我