当前位置：首页 > news >正文

python爬虫--小白篇【爬虫实践】

news 2026/2/10 17:03:46

一、前言

1.1、王者荣耀皮肤爬虫

根据王者荣耀链接，将王者荣耀的全部英雄的全部皮肤图片爬取保存到本地。经过分析得到任务的三个步骤：

根据首页全部英雄列表连接获取全部英雄的名称hero_name以及对应的hero_id；
根据单个英雄的hero_name和hero_id去查找该英雄每张皮肤图片的下载连接；
根据单张皮肤图片链接地址下载并保存图片内容到文件夹中；

1.2、腾讯动漫图片爬虫

将腾讯动漫链接中每章节中的动漫图片爬取下来保存到本地。经过分析可知，只需要获取每张动漫图片的下载地址即可，然后在每章节后点击下一章按钮即可获取其他章节的动漫图片下载链接。其中需要注意的是需要通过动作链去模拟鼠标滑动的操作，可以通过ActionChains(browser).scroll_to_element(pic).perform()完成该操作。

1.3、m3u8视频爬虫

根据单个AcFun视频链接，将视频爬取保存到本地。经过分析可知，可以分为三个步骤：

获取m3u8列表文件；
提取所有视频片段的播放地址ts文件；
下载并合并视频片段；

二、案例

2.1、王者荣耀皮肤爬虫演示

"""
@Author :江上挽风&sty
@Blog(个人博客地址):https://blog.csdn.net/weixin_56097064
@File :王者荣耀图片下载
@Time :2024/12/9 13:58
@Motto:一直努力，一直奋进，保持平常心"""
import os.path
import pprint
import reimport requests
from bs4 import BeautifulSoup
# https://game.gtimg.cn/images/yxzj/img201606/skin/hero-info/558/558-bigskin-1.jpg
# https://game.gtimg.cn/images/yxzj/img201606/skin/hero-info/577/577-bigskin-2.jpg
header = {"user-agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/131.0.0.0 Safari/537.36 Edg/131.0.0.0"
}# 根据英雄皮肤的连接下载并保存对应的英雄皮肤图片
def download_pic(pic_url, path, pic_name, hero_name):pic_content = requests.get(pic_url, headers=header).contentif not os.path.exists(f'{path}/{hero_name}'):os.mkdir(f'{path}/{hero_name}')with open(f'{path}/{hero_name}/{pic_name}.jpg', 'wb') as f:f.write(pic_content)print(f"{pic_name}下载成功")# 获取英雄的全部图片（单个英雄对应多个皮肤图片）
def get_hero_pics(hero_id,hero_name):hero_url = f"https://pvp.qq.com/web201605/herodetail/{hero_id}.shtml"r = requests.get(hero_url, headers=header)# apparent_encoding 是 Python requests 库中的一个属性，用于从响应内容中分析得出的编码方式r.encoding = r.apparent_encoding# print(r.text)soup = BeautifulSoup(r.text, 'html.parser')content = soup.find('ul', class_="pic-pf-list pic-pf-list3").get('data-imgname')pic_names = re.sub('&\d+', '', content).split('|')for num, pic_name in enumerate(pic_names):num += 1pic_url = f"https://game.gtimg.cn/images/yxzj/img201606/skin/hero-info/{hero_id}/{hero_id}-bigskin-{num}.jpg"download_pic(pic_url, path, pic_name, hero_name)# 获取全部英雄的名称和对应的hero_id
def get_hero(hero_url):hero_list = requests.get(hero_url,headers=header).json()# 这个函数主要用于以一种美观、格式化的方式打印复杂的数据结构，如多层嵌套的列表、元组和字典等。它能够使输出的结果显示得更加清晰和易于阅读pprint.pprint(hero_list)for hero in hero_list:hero_name = hero['cname']hero_id = hero['ename']get_hero_pics(hero_id,hero_name)if __name__ == '__main__':"""1、根据首页全部英雄列表连接获取全部英雄的名称hero_name以及对应的hero_id2、根据单个英雄的hero_name和hero_id去查找该英雄的全部皮肤碎片的数量，获取每张皮肤图片的下载连接3、根据单张皮肤图片链接地址下载并保存图片内容到文件夹中"""path = "D:\\ProjectCode\\Spider\\StudySpider07\\heros"heroes_url = "https://pvp.qq.com/web201605/js/herolist.json"get_hero(heroes_url)

2.2、腾讯动漫图片爬虫演示

"""
@Author :江上挽风&sty
@Blog(个人博客地址):https://blog.csdn.net/weixin_56097064
@File :腾讯动漫图片下载
@Time :2024/12/9 15:26
@Motto:一直努力，一直奋进，保持平常心"""
import os.path
import timeimport requests
from selenium import webdriver
from selenium.webdriver.edge.service import Service
from selenium.webdriver.edge.options import Options
from selenium.webdriver.common.by import By
from selenium.webdriver.common.action_chains import ActionChainsservice = Service(executable_path='D:\ApplicationsSoftware\EdgeDriver\edgedriver_win32\msedgedriver.exe')
opt = Options()
opt.add_argument('--disable-blink-features=AutomationControlled')
# opt.headless = True# 下载动漫图片
def download(url ,path):browser = webdriver.Edge(service=service, options=opt)browser.maximize_window()browser.get(url)time.sleep(1)filename = browser.find_element(by=By.XPATH,value='//*[@id="comicTitle"]/span[@class="title-comicHeading"]').textpic_list = browser.find_elements(by=By.XPATH, value='//*[@id="comicContain"]/li/img')for num, pic in enumerate(pic_list):time.sleep(0.5)ActionChains(browser).scroll_to_element(pic).perform()link = pic.get_attribute('src')pic_content = requests.get(link).contentif not os.path.exists(f'{path}/{filename}'):os.mkdir(f'{path}/{filename}')with open(f'{path}/{filename}/{num}.jpg', 'wb') as f:f.write(pic_content)# print(link)print(f"已下载...{filename}....第{num+1}张图片")next_page = browser.find_element(by=By.XPATH, value='//*[@id="mainControlNext"]').get_attribute('href')browser.close()return next_pageif __name__ == '__main__':path = "D:\\ProjectCode\\Spider\\StudySpider07\\动漫"url = "https://ac.qq.com/ComicView/index/id/656073/cid/68282"while url:url = download(url, path)

2.3、m3u8视频爬虫演示

"""
@Author :江上挽风&sty
@Blog(个人博客地址):https://blog.csdn.net/weixin_56097064
@File :视频爬虫
@Time :2024/12/9 16:37
@Motto:一直努力，一直奋进，保持平常心"""
import pprint
import re
import json
import requests
from tqdm import tqdm # 进度条模块
from bs4 import BeautifulSoupheader = {"user-agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/131.0.0.0 Safari/537.36 Edg/131.0.0.0"
}# 获取m3u8列表文件
def get_m3u8_list(url):resp = requests.get(url,headers=header)# print(resp.text)# 正则表达式去匹配info = re.findall('window.pageInfo = window.videoInfo = (.*?) window.videoResource', resp.text, re.S)[0].strip()[:-1]# 逐层剥开找到m3u8地址info_json = json.loads(json.loads(info)['currentVideoInfo']['ksPlayJson'])['adaptationSet'][0]['representation'][0]['url']filename = json.loads(info)['title']# print(filename)# pprint.pp(info_json)return info_json,filename# 提取所有视频片段的播放地址ts文件
def get_ts_files(m3u8_url):resp = requests.get(m3u8_url, headers=header)# print(resp.text)ts_files = re.sub('#.*', '', resp.text).strip()return ts_files# 下载并合并视频片段
def download_combine(ts_files, path, filename):with open(f'{path}/{filename}.mp4', 'ab') as f:for ts in tqdm(ts_files):# 地址拼接ts = 'https://ali-safety-video.acfun.cn/mediacloud/acfun/acfun_video/' + ts# 获取地址二进制流内容ts_content = requests.get(ts, headers=header).contentf.write(ts_content)# # 获取目录页的视频链接
# def get_index_link():
#     index_url = 'https://www.acfun.cn/rest/pc-direct/homePage/searchDefault'
#     resp = requests.get(index_url, headers=header)
#     print(resp.text)
#     soup = BeautifulSoup(resp.text, 'html.parser')
#     link_list = soup.findAll('a', class_="list-wrap")
#     # 遍历所有的<a>标签并打印它们的href属性值
#     for tag in link_list:
#         href = tag.get('href')
#         if href:  # 确保href属性存在
#             print(href)
#
#     else:
#         print('请求失败，状态码：', resp.status_code)
#     print(link_list)def main():url = "https://www.acfun.cn/v/ac46628128"path = "D:\\ProjectCode\\Spider\\StudySpider07\\videos"m3u8_url, filename = get_m3u8_list(url)ts_files = get_ts_files(m3u8_url)download_combine(ts_files, path, filename)# get_index_link()if __name__ == '__main__':main()

python爬虫--小白篇【爬虫实践】

一、前言 1.1、王者荣耀皮肤爬虫根据王者荣耀链接，将王者荣耀的全部英雄的全部皮肤图片爬取保存到本地。经过分析得到任务的三个步骤： 根据首页全部英雄列表连接获取全部英雄的名称hero_name以及对应的hero_id；根据单个英雄的hero_name和h…...

编程日记 2024/12/15 4:17:52

Unity背包道具拖拽（极简版实现）

（感觉Csdn代码页面可以再大一点或者加个放大功能不然得划着看不太舒服） 1.关键接口，三个拖拽相关的 2.关键参数，PointerEventData 一直没仔细看过，其实有包含鼠标相关的很多参数，鼠标点击次数&#xff…...

编程日记 2024/12/15 4:11:43

spark读取普通文件

spark读取普通文件 txt文件 """ 将一行数据当做一个字段，需要自己切割字段名称为value 表结构可以从sql中搞 """ df spark.read.text("../../data/wordcount/input/data.txt") df spark.read.format("text"…...

编程日记 2024/12/15 4:10:41

MySQL SQL语句性能优化

MySQL SQL语句性能优化指南一、查询设计优化1. 避免 SELECT *2. 使用 WHERE 进行条件过滤3. 避免在索引列上使用函数和表达式4. 使用 LIMIT 限制返回行数5. 避免使用子查询6. 优化 JOIN 操作7. 避免全表扫描二、索引优化1. 使用合适的索引2. 覆盖索引3. 索引选择性4. 多列索引…...

编程日记 2024/12/15 4:06:37

【蓝桥杯每日一题】技能升级

技能升级 2024-12-10 蓝桥杯每日一题技能升级二分题目大意一个角色有 N 种可以增加攻击力的技能，对于第 i 个技能首次升级可以提升 A i A_i Ai 点攻击力，随后的每次升级增加的攻击力都会减少 B i B_i Bi 。升级 ⌈ A i B i ⌉ \lceil \frac{A…...

编程日记 2024/12/15 4:03:34

css 实现在一条线上流动小物体（offset-path）

直接贴代码，留几个参考网址给大家【SVG】路径＜Path＞标签详解，一次搞懂所有命令参数探秘神奇的运动路径动画 Motion Path <!DOCTYPE html> <html lang="en"> <head><meta charset="UTF-8"><meta name="viewport&quo…...

编程日记 2024/12/15 4:02:30

探索 Robyn 框架 —— 下一代高性能 Web 框架

技术博客：探索 Robyn 框架 —— 下一代高性能 Web 框架什么是 Robyn？ Robyn 是一个用 Rust 编写的高性能 Web 框架，旨在通过极简设计和高效并发处理，帮助开发者快速构建可扩展的现代 Web 应用。得益于 Rust 的内存安全性和性能…...

编程日记 2024/12/15 4:00:28

STL容器-map P3613【深基15.例2】寄包柜普及-

题目来源：洛谷题库文章目录 map例题map知识点map使用注意：map的常用用法 map例题 P3613【深基15.例2】寄包柜普及- 题意根据数据插入/查询思路 map键值对可以根据柜子编号查找物品，但是柜子又有很多个，考虑数组或者map数组…...

编程日记 2024/12/15 3:55:19

【MySQL 进阶之路】了解性能优化与设计原则

1.B树的优势 “矮胖”结构： 矮：B树的每个节点存储更多的关键字，从而减少了树的层级（最多三层），减少了磁盘I/O操作，提高了查询效率。胖：叶子节点存储实际的数据，并使用双…...

编程日记 2024/12/15 3:54:14

MySQL之数据库三大范式

一、什么是范式？ 范式是数据库遵循设计时遵循的一种规范，不同的规范要求遵循不同的范式。 （范式是具有最小冗余的表结构） 范式可以提高数据的一致性和减少数据冗余和更新异常的问题数据库有六种范式（1NF/2NF/3NF…...

编程日记 2024/12/15 3:52:08

[大数据]Hudi

G:\Bigdata\17.hudi\大数据技术之数据湖Hudi 第1章 Hudi概述 1.1 Hudi简介 Apache Hudi（Hadoop Upserts Delete and Incremental）是下一代流数据湖平台。Apache Hudi将核心仓库和数据库功能直接引入数据湖。Hudi提供了表、事务、高效的upserts/delete、高级索引、流摄取服…...

编程日记 2024/12/15 3:51:07

jenkins harbor安装

Harbor是一个企业级Docker镜像仓库‌。文章目录 1. 什么是Docker私有仓库2. Docker有哪些私有仓库3. Harbor简介4. Harbor安装 1. 什么是Docker私有仓库 Docker私有仓库是用于存储和管理Docker镜像的私有存储库。Docker默认会有一个公共的仓库Docker Hub，而与Dock…...

编程日记 2024/12/15 3:50:05

JavaScript 高级特性与 ES6 新特性：正则表达式的深度探索

在现代 JavaScript 开发中，正则表达式（Regular Expressions）和高级特性、ES6 新特性的结合使用，能够极大地提升代码的简洁性、可读性和功能性。本文将深入探讨 JavaScript 中的正则表达式及其在高级特性和 ES6 新特性中的应用&…...

编程日记 2024/12/15 3:41:58

正则表达式——参考视频B站《奇乐编程学院》

智能指针一、背景🎈1.1. 模式匹配🎈1.2. 文本替换🎈1.3. 数据验证🎈1.4. 信息提取🎈1.5. 拆分字符串🎈1.6. 高级搜索功能二、原料2.1 参考视频2.2 验证网址三、用法3.1 限定符3.1.1 ?3.1.2 *3.1.3 3.1.…...

编程日记 2024/12/15 3:34:53

【FFmpeg】FFmpeg 内存结构 ⑥ ( 搭建开发环境 | AVPacket 创建与释放代码分析 | AVPacket 内存使用注意事项 )

文章目录一、搭建开发环境1、开发环境搭建参考2、项目搭建二、AVPacket 创建与释放代码分析1、AVPacket 创建与释放代码2、Qt 单步调试方法3、单步调试 - 分析 AVPacket 创建与销毁代码三、AVPacket 内存使用注意事项1、谨慎使用 av_init_packet 函数2、av_init_packet 函数…...

编程日记 2024/12/15 3:22:41

【多模态文档智能】OCR-free感知多模态大模型技术链路及训练数据细节

目前的一些多模态大模型的工作倾向于使用MLLM进行推理任务，然而，纯OCR任务偏向于模型的感知能力，对于文档场景，由于文字密度较高，现有方法往往通过增加图像token的数量来提升性能。这种策略在增加新的语言时&#xff0…...

编程日记 2024/12/15 3:17:33

Mybatis动态sql执行过程

动态SQL的执行原理主要涉及到在运行时根据条件动态地生成SQL语句，然后将其发送给数据库执行。以下是动态SQL执行原理的详细解释： 一、接收参数动态SQL首先会根据用户的输入或系统的条件接收参数。这些参数可以是查询条件、更新数据等，它们…...

编程日记 2024/12/15 3:10:27

leetcode 31 Next Permutation

题意找到下一个permutation是什么，对于一个数组[1，2，3]，下一个排列就是[1, 3, 2] 链接 https://leetcode.com/problems/next-permutation/ 思考首先任何一个permutation满足一个性质，从某个位置往后一定是降序。…...

编程日记 2024/12/15 3:09:26

每日一练 | 华为 eSight 创建的缺省角色

01 真题题目下列选项中，不属于华为 eSight 创建的缺省角色的是： A. Administrator B. Monitor C. Operator D. End-User 02 真题答案 D 03 答案解析华为 eSight 是一款综合性的网络管理平台，提供了多种管理和监控功能。为了确保不同用…...

编程日记 2024/12/15 3:05:22

PyTorch基本使用-自动微分模块

学习目的：掌握自动微分模块的使用训练神经网络时，最常用的算法就是反向传播。在该算法中，参数（模型权重）会根据损失函数关于对应参数的梯度进行调整。为了计算这些梯度，PyTorch 内置了名为 torch.autogra…...

编程日记 2024/12/15 2:59:14

UE5 学习系列（二）用户操作界面及介绍

这篇博客是 UE5 学习系列博客的第二篇，在第一篇的基础上展开这篇内容。博客参考的 B 站视频资料和第一篇的链接如下： 【Note】：如果你已经完成安装等操作，可以只执行第一篇博客中 2. 新建一个空白游戏项目章节操作，重…...

编程新知 2026/2/10 11:02:44

Mac软件卸载指南，简单易懂！

刚和Adobe分手，它却总在Library里给你写"回忆录"？卸载的Final Cut Pro像电子幽灵般阴魂不散？总是会有残留文件，别慌！这份Mac软件卸载指南，将用最硬核的方式教你"数字分手术"&#xff0…...

编程新知 2026/2/7 0:48:56

文章目录 A 基础语言模型A.1 TransformerA.2 Bert B 大语言模型结构B.1 GPTB.2 LLamaB.3 ChatGLMB.4 Qwen C 大语言模型微调C.1 Fine-tuningC.2 Adapter-tuningC.3 Prefix-tuningC.4 P-tuningC.5 LoRA A 基础语言模型 A.1 Transformer （1）资源论文&a…...

编程新知 2026/1/23 11:58:06