爬虫实战——scrapy框架爬取多张图片
scrapy框架的基本使用,请参考我的另一篇文章:scrapy框架的基本使用
起始爬取的网页如下:
点击每张图片,可以进入图片的详情页,如下:
代码实现:
项目文件结构如下
img_download.py文件代码
import scrapy
# 这里导包的时候会显示报错,但其实不影响运行,如果想去掉,可以百度一下方法
from caixin591.items import Caixin591Itemclass ImgDownloadSpider(scrapy.Spider):name = "img_download"allowed_domains = ["m.mms591.com"]# 修改默认的爬虫入口# start_urls = ["https://m.mms591.com"]start_urls = ["https://m.mms591.com/filter.php?q=dongwu_zhiwu-0-0-755-2"]def parse(self, response, **kwargs):# print(response.text) # 打印页面源代码# 从页面源代码中拿到图片详情网址# 这里有多种方法进行解析,大家可以按照自己的思路来# 我这里先拿到每个图片所在lilis = response.xpath('//div[@class="am-list-news-bd"]/ul/li')for li in lis:href = li.xpath('./div/a/@href').extract_first()# 这里拿到的地址是不完整的,需要拼接完整的URL# print(href) # '/dongwu-zhiwu/1015_he-ma.html'# 之前我们是用from urllib.parse import urljoin进行拼接# 但是scrapy中的response对象有相应的URL拼接方法detail_img = response.urljoin(href)# print(detail_img) # https://m.mms591.com/dongwu-zhiwu/1023_qi-e.html# 向图片的详情地址发送请求# 之前我们说爬虫程序要么解析出具体的数据,传递给引擎,然后通过引擎传递给通道# 要么解析出新的URL,然后传递给引擎,引擎封装成request对象,再给调度器# 所以这里我们解析出了一个新的URL,那么就封装成request对象,# 至于引擎是怎么给调度器、怎么发送这个请求得到数据的不用我们关心req = scrapy.Request(url=detail_img, # 要请求的地址method='get', # 请求的方式# 这里是自定义一个解析函数# 请求返回的内容交给谁进行数据解析callback=self.parse_detail_page)# 把请求返回给引擎yield reqbreak# 上面的过程只下载了一页图片,如果我们想下载多页图片,可以在这里进行# 可以一次性拿到所有分页的URL,然后协程或者for循环进行下载# 这里采取拿到“下一页”这个按钮的URL,然后一页一页的下载# 相当于不断地手动点击下一页这个按钮# 从页面中获取下一页按钮的URL# 这里的URL也是不完整的,需要拼接next_page_url = response.xpath(# a[contains(text(), "下一页")] 表示获取文本内容包含“下一页”的a标签'//ul[@data-am-widget="pagination"]/li/a[contains(text(), "下一页")]/@href').extract_first()print(next_page_url)if next_page_url: # 如果有下一页yield scrapy.Request(url=response.urljoin(next_page_url),method='get',# 请求返回的又是一页新的有多个图片的页面,解析逻辑桶上面,所以调用parse方法callback=self.parse)def parse_detail_page(self, response):"""在这个函数里对图片的详情页进行解析,这个方法是自定义的:param response: 请求详情页网址时返回的内容:return:"""# print(response.text)# 拿到图片真正的下载地址img_url = response.xpath('//img[@class="mainimg"]/@src').extract_first()# print(img_url)title = response.xpath('//h3/text()').extract_first()# print(title)item = Caixin591Item()item['img_url'] = img_urlitem['title'] = titleyield item # 把具体的数据传递给管道
settings.py文件代码(删掉了没有用到的注释代码)
BOT_NAME = "caixin591"SPIDER_MODULES = ["caixin591.spiders"]
NEWSPIDER_MODULE = "caixin591.spiders"# Obey robots.txt rules
ROBOTSTXT_OBEY = TrueITEM_PIPELINES = {"caixin591.pipelines.Caixin591Pipeline": 300,"caixin591.pipelines.DownloadImgPipeline": 299
}# 配置日志界别
LOG_LEVEL = 'WARNING'# 配置保存图片的文件夹
IMAGES_STORE = './images'# 要配置这个,否则图片管道下载图片的时候会报错:
# File (code: 301): Error downloading file from <GET http:...> referred in <None>
MEDIA_ALLOW_REDIRECTS = TrueREQUEST_FINGERPRINTER_IMPLEMENTATION = "2.7"
TWISTED_REACTOR = "twisted.internet.asyncioreactor.AsyncioSelectorReactor"
FEED_EXPORT_ENCODING = "utf-8"
pipelines.py文件代码
import scrapy
from scrapy.pipelines.images import ImagesPipelineclass Caixin591Pipeline:def process_item(self, item, spider):return item# 下载图片
# 这里利用图片管道完成图片下载操作
# 注意要在settings文件中配置保存文件的文件夹
class DownloadImgPipeline(ImagesPipeline):# 下面三个方法都是重写ImagesPipeline类中的def get_media_requests(self, item, info):# 本方法负责发送请求进行下载# item 就是爬虫程序传递过来的数据# img_url是图片真正的下载地址,发送请求后会返回图片的字节信息# 而把图片的字节存储起来这一操作我们不需要关心# 只需要实现这三个方法就可以完成下载图片到本地这一需求req = scrapy.Request(url=item['img_url'], method='get')return req # 把请求返回给引擎# 上面是封装一个请求然后下载一次,应该也可以先封装好所有请求然后一起下载# 但是我没尝试过,感兴趣的可以试一试def file_path(self, request, response=None, info=None, *, item=None):# 本方法负责提供图片文件的存储路径# request这里对应着上面方法get_media_requests中的req# 一个图片对应一个req# 和以前一样,我们以URL的最后一部分命名图片# 请求的URL可以通过request.url获取file_name = request.url.split('/')[-1]return f'img/{file_name}' # 返回图片文件的存储路径def item_completed(self, results, item, info):# 本方法可以拿到文件的详细信息# 可以自己打印出来看看具体有什么东西# print(results)# print(item)# print(info)pass
items.py文件代码
import scrapyclass Caixin591Item(scrapy.Item):img_url = scrapy.Field()title = scrapy.Field()
相关文章:

爬虫实战——scrapy框架爬取多张图片
scrapy框架的基本使用,请参考我的另一篇文章:scrapy框架的基本使用 起始爬取的网页如下: 点击每张图片,可以进入图片的详情页,如下: 代码实现: 项目文件结构如下 img_download.py文件代码 im…...
LLVM TableGen 系统学习笔记
Basic TableGen 系统可以帮助记录领域特定的信息。它也可以认为是一种小型的编译系统。 TableGen 责负分析文件, 分析结果交给领域特定的后端进行处理。 重要的概念 records 一个 record 有一个独立的名称,一系列值和一系列父类。 它保存了特定领域…...

基于stm32的流水灯设计
1基于stm32的流水灯设计[proteus仿真] 速度检测系统这个题目算是课程设计和毕业设计中常见的题目了,本期是一个基于51单片机的自行车测速系统设计 需要的源文件和程序的小伙伴可以关注公众号【阿目分享嵌入式】,赞赏任意文章 2¥,…...
kotlin图片合成和压缩
kotlin图片合成和压缩 之前的方法是继承AsyncTask 在doInBackground 里面去做压缩的操作,然后用 publishProgress 切到主线程里面更新 新方法是在协程里的去做 class ImageService {private fun getSumWidths(bitmaps: ArrayList<Bitmap>): Int {var sumWid…...
Java学习笔记004——接口概念理解及意义
一个类中有抽象方法,则必须声明为abstract(做为抽象类),抽象类不能实例化。子类继承抽象类,必须对所有的抽象方法重写,否则依然有抽象方法,还是抽象的,无法实例化。故抽象类常做为基…...

MT笔试题
前言 某团硬件工程师的笔试题,个人感觉题目的价值还是很高的,分为选择题和编程题,选择题考的是嵌入式基础知识,编程题是两道算法题,一道为简单难度,一道为中等难度 目录 前言选择题编程题 选择题 C语言中变…...
50道SQL面试题
50道SQL面试题 有需要互关的小伙伴,关注一下,有关必回关,争取今年认证早日拿到博客专家 环境 -- ---------------------------- -- Table structure for teacher -- ---------------------------- DROP TABLE IF EXISTS teacher; CREATE TABLE teacher (t_id varchar(20) …...

2024蓝桥杯每日一题(双指针)
一、第一题:牛的学术圈 解题思路:双指针贪心 仔细思考可以知道,写一篇综述最多在原来的H指数的基础上1,所以基本方法可以是先求出原始的H指数,然后分类讨论怎么样提升H指数。 【Python程序代码】 n,l map(int,…...
Android 开发过程中常见的内存泄漏场景分析
场景1 Static变量存储上下文环境Context public class ClassName {// 定义1个静态变量private static Context mContext;//... // 引用的是Activity的contextmContext context; // 当Activity需销毁时,由于mContext 静态 & 生命周期 应用程序的生命周期&…...
Codeforces-1935E:Distance Learning Courses in MAC(思维)
E. Distance Learning Courses in MAC time limit per test 2 seconds memory limit per test 256 megabytes input standard input output standard output The New Year has arrived in the Master’s Assistance Center, which means it’s time to introduce a new feature…...
ZooKeeper和Diamond有什么不同
本文主要是讨论下两个类似产品:ZooKeeper和Diamond在配置管理这个应用场景上的异同点。 Diamond,顾名思义,寄寓了开发人员对产品稳定性的厚望,希望它像钻石一样,提供稳定的配置访问。Diamond是淘宝网Java中间件团队的核…...
三、N元语法(N-gram)
为了弥补 One-Hot 独热编码的维度灾难和语义鸿沟以及 BOW 词袋模型丢失词序信息和稀疏性这些缺陷,将词表示成一个低维的实数向量,且相似的词的向量表示是相近的,可以用向量之间的距离来衡量相似度。 N-gram 统计语言模型是用来计算句子概率的…...
QML 3D入门知识路线
目前使用的版本 v5.14.0 模块导入 使用QML 3D时需要 import Qt3D.Core 2.14 核心模块类 V6以上的版本已经发布,所以有很多module会发生变化,主要有核心module、输入、逻辑、渲染、动画和扩展module,以及2D/3D场景模块 类名 能…...
蓝牙系列五:开源蓝牙协议BTStack框架代码阅读(1)
蓝牙学习系列,借鉴卫东上老师的蓝牙视频教程。 BTStack协议栈学习。首先来看一下,对于硬件操作,它是如何来进行处理的。在上篇文章中曾说过,在main函数里面它会调用硬件相关的代码,调用操作系统相关的代码。在BTStack中,可以搜索一下main.c,将会发现有很多main.c,都是…...
c++ 类内可以定义引用数据成员吗?
在C中,类内是可以定义引用数据成员的,但是在初始化对象时,必须在构造函数的成员初始化列表中对引用进行初始化,因为引用必须在创建时被初始化,并且不能在其生存期内引用不同的对象。下面是一个简单的示例: …...

MacBook2024苹果免费mac电脑清理垃圾软件CleanMyMac X
CleanMyMac X是一款专业的Mac清理软件,具备多种强大功能。首先,它能够智能清理Mac磁盘上的垃圾文件和多余语言安装包,从而快速释放电脑内存。其次,CleanMyMac X可以轻松管理和升级Mac上的应用,同时强力卸载恶意软件并修…...

Vue.js计算属性:实现数据驱动的利器
🤍 前端开发工程师、技术日更博主、已过CET6 🍨 阿珊和她的猫_CSDN博客专家、23年度博客之星前端领域TOP1 🕠 牛客高级专题作者、打造专栏《前端面试必备》 、《2024面试高频手撕题》 🍚 蓝桥云课签约作者、上架课程《Vue.js 和 E…...

10-ARM gicv3/gicv4的总结-基础篇
目录 1、gic的版本2、GICv3/gicv4的模型图3、gic中断号的划分4、GIC连接方式5、gic的状态6、gic框架7、gic Configuring推荐 本文转自 周贺贺,baron,代码改变世界ctw,Arm精选, armv8/armv9,trustzone/tee,s…...

数据库系统概论(超详解!!!) 第三节 关系数据库
1.基本概念 1. 域(Domain) 域是一组具有相同数据类型的值的集合。 2. 笛卡尔积(Cartesian Product) 给定一组域D1,D2,…,Dn,允许其中某些域是相同的。 D1,D2…...

Springboot 集成kafka 消费者实现ssl方式连接监听消息实现消费
证书准备:springboot集成kafka 消费者实现 如何配置是ssl方式连接的时候需要进行证书的转换。原始的证书是pem, 或者csr方式 和key方式的时候需要转换,因为kafka里面是jks 需要通过openssl进行转换。 证书处理: KeyStore 用于存储客户端的证…...

XML Group端口详解
在XML数据映射过程中,经常需要对数据进行分组聚合操作。例如,当处理包含多个物料明细的XML文件时,可能需要将相同物料号的明细归为一组,或对相同物料号的数量进行求和计算。传统实现方式通常需要编写脚本代码,增加了开…...
【Linux】shell脚本忽略错误继续执行
在 shell 脚本中,可以使用 set -e 命令来设置脚本在遇到错误时退出执行。如果你希望脚本忽略错误并继续执行,可以在脚本开头添加 set e 命令来取消该设置。 举例1 #!/bin/bash# 取消 set -e 的设置 set e# 执行命令,并忽略错误 rm somefile…...

练习(含atoi的模拟实现,自定义类型等练习)
一、结构体大小的计算及位段 (结构体大小计算及位段 详解请看:自定义类型:结构体进阶-CSDN博客) 1.在32位系统环境,编译选项为4字节对齐,那么sizeof(A)和sizeof(B)是多少? #pragma pack(4)st…...

HBuilderX安装(uni-app和小程序开发)
下载HBuilderX 访问官方网站:https://www.dcloud.io/hbuilderx.html 根据您的操作系统选择合适版本: Windows版(推荐下载标准版) Windows系统安装步骤 运行安装程序: 双击下载的.exe安装文件 如果出现安全提示&…...
unix/linux,sudo,其发展历程详细时间线、由来、历史背景
sudo 的诞生和演化,本身就是一部 Unix/Linux 系统管理哲学变迁的微缩史。来,让我们拨开时间的迷雾,一同探寻 sudo 那波澜壮阔(也颇为实用主义)的发展历程。 历史背景:su的时代与困境 ( 20 世纪 70 年代 - 80 年代初) 在 sudo 出现之前,Unix 系统管理员和需要特权操作的…...

CMake 从 GitHub 下载第三方库并使用
有时我们希望直接使用 GitHub 上的开源库,而不想手动下载、编译和安装。 可以利用 CMake 提供的 FetchContent 模块来实现自动下载、构建和链接第三方库。 FetchContent 命令官方文档✅ 示例代码 我们将以 fmt 这个流行的格式化库为例,演示如何: 使用 FetchContent 从 GitH…...
css3笔记 (1) 自用
outline: none 用于移除元素获得焦点时默认的轮廓线 broder:0 用于移除边框 font-size:0 用于设置字体不显示 list-style: none 消除<li> 标签默认样式 margin: xx auto 版心居中 width:100% 通栏 vertical-align 作用于行内元素 / 表格单元格ÿ…...
安卓基础(aar)
重新设置java21的环境,临时设置 $env:JAVA_HOME "D:\Android Studio\jbr" 查看当前环境变量 JAVA_HOME 的值 echo $env:JAVA_HOME 构建ARR文件 ./gradlew :private-lib:assembleRelease 目录是这样的: MyApp/ ├── app/ …...

云原生玩法三问:构建自定义开发环境
云原生玩法三问:构建自定义开发环境 引言 临时运维一个古董项目,无文档,无环境,无交接人,俗称三无。 运行设备的环境老,本地环境版本高,ssh不过去。正好最近对 腾讯出品的云原生 cnb 感兴趣&…...

html css js网页制作成品——HTML+CSS榴莲商城网页设计(4页)附源码
目录 一、👨🎓网站题目 二、✍️网站描述 三、📚网站介绍 四、🌐网站效果 五、🪓 代码实现 🧱HTML 六、🥇 如何让学习不再盲目 七、🎁更多干货 一、👨…...