600字范文 > Python爬虫入门【17】：高考派大学数据抓取 scrapy

Python爬虫入门【17】：高考派大学数据抓取 scrapy

时间：2023-03-15 11:20:46

1.高考派大学数据----写在前面

写到终于了scrapy爬虫框架了，这个框架可以说是蟒爬虫框架里面出镜率最高的一个了，我们接下来重点研究一下它的使用规则。

安装过程自己百度一下，就能找到3种以上的安装手法，一个哪都可以安装上

可以参考https://scrapy-chs.readthedocs.io/zh_CN/0.24/intro/install.html官方说明进行安装。

2.高考派大学数据----创建scrapy项目

通用使用下面的命令，创建即可

scrapy startproject mySpider

完成之后，你的项目的目录结构为

每个文件对应的意思为

scrapy.cfg项目的配置文件mySpider /根目录mySpider / items.py项目的目标文件，规范数据格式，用来定义解析对象对应的属性或字段。mySpider / pipelines.py项目的管道文件，负责处理被蜘蛛提取出来的项目。典型的处理有清理，验证及持久化（例如存取到数据库）mySpider / settings.py项目的设置文件mySpider / spiders /爬虫主目录*middlewares.py Spider中间件是在引擎及Spider之间的特定钩子（具体钩子），处理蜘蛛的输入（响应）和输出（items及requests）。其提供了一个简便的机制，通过插入自定义代码来扩展Scrapy功能。*本篇文章没有涉及