当前位置：首页 > news >正文

PyTorch - Conv2d 和 MaxPool2d

news 2026/2/10 16:40:24

文章目录

- Conv2d
- - 计算
  - Conv2d 函数解析
  - 代码示例
- MaxPool2d
- - 计算
  - 函数说明
- 卷积过程动画
- - - Transposed convolution animations
    - Transposed convolution animations

参考视频：土堆说卷积计算
https://www.bilibili.com/video/BV1hE411t7RN

关于 torch.nn 和 torch.nn.function
torch.nn 是对 torch.nn.function 的封装，前者更方便实用。

Conv2d

卷积过程可见文末动画

计算

卷积层输入特征图(input feature map)的尺寸为：H_i × W_i × C_i

H_i ：输入特征图的高
W_i ：输入特征图的宽
C_i ：输入特征图的通道数
（如果是第一个卷积层则是输入图像的通道数，如果是中间的卷积层，则是上一层的输出通道数

卷积层的参数如下：

P：padding，补零的行数和列数
F：正方形卷积核的边长
S：stride，步幅
K：输出通道数

输出特征图(output feature map)的尺寸为 H_o × W_o × C_o ，其中每一个变量的计算方式如下：

H_o = (H_i + 2P − F)/S + 1
W_o = (W_i + 2P − F)/S + 1
C_o = K

卷积时，超出边界的不计算。

参数量大小的计算，分为weights和biases：

首先，计算weights的参数量：F × F × C_i × K
接着计算biases的参数量：K
所以总参数量为：F × F × C_i × K + K

计算示例

输入	卷积核	步长	padding	输出	计算
5x5	2x2	1	0	4x4	4 = (5-2)/1 + 1
5x5	3x3	1	0	3x3	3 = (5-3)/1 + 1
5x5	2x2	2	0	2x2	2 = (5-2)/2 + 1
6x6	2x2	2	0	3x3	3 = (6-2)/2 + 1
5x5	2x2	1	1	6x6	4 = (5 + 1*2 - 2)/1 + 1
5x5	3x3	1	1	5x5	3 = (5 + 1*2 - 3)/1 + 1
5x5	3x3	2	2	4x4	3 = (5 + 2*2 - 3)/2 + 1

Conv2d 函数解析

torch.nn.functional.conv2d 官方说明
https://pytorch.org/docs/stable/generated/torch.nn.functional.conv2d.html#torch.nn.functional.conv2d

torch.nn.Conv2d(in_channels, out_channels, kernel_size, stride=1, padding=0, dilation=1, groups=1, bias=True, padding_mode=‘zeros’, device=None, dtype=None)

in_channels
out_channels
kernel_size，卷积核大小；可以是一个数（n*n矩阵），也可以是一个元组。这个值在训练过程中，会不断被调整。
stride=1
padding=0
dilation=1，卷积核对应位的距离
groups=1，分组卷积；一般为1，很少改动。
bias=True，偏置，一般为True
padding_mode=‘zeros’，如果设置了 padding，填充模式。默认为 zeros，即填充0。
device=None
dtype=None)

一般只设置前五个参数

代码示例

import torch
import torch.nn.functional as Ft1 = torch.Tensor([[1, 2, 0, 3, 1], [0, 1, 2, 3, 1],[1, 2, 1, 0, 0],[5, 2, 3, 1, 1],[2, 1, 0, 1, 1], ])kernel = torch.Tensor([[1, 2, 1],[0, 1, 0],[2, 1, 0]
])
t1.shape, kernel.shape
# (torch.Size([5, 5]), torch.Size([3, 3]))# channel 和 batch_size 为 1
ip = torch.reshape(t1, (1, 1, 5, 5))
kernel = torch.reshape(kernel, (1, 1, 3, 3))
ip.shape, kernel.shape
# (torch.Size([1, 1, 5, 5]), torch.Size([1, 1, 3, 3]))op = F.conv2d(ip, kernel, stride=1) 
op, op.shape 
'''
(tensor([[[[10., 12., 12.],[18., 16., 16.],[13.,  9.,  3.]]]]),torch.Size([1, 1, 3, 3]))
'''# 不同 stride
op = F.conv2d(ip, kernel, stride=2) 
op, op.shape 
'''
(tensor([[[[10., 12.],[13.,  3.]]]]),torch.Size([1, 1, 2, 2]))
'''# 增加 padding
op = F.conv2d(ip, kernel, stride=2, padding=1) 
op, op.shape 
'''
(tensor([[[[ 1.,  4.,  8.],[ 7., 16.,  8.],[14.,  9.,  4.]]]]),torch.Size([1, 1, 3, 3]))
'''

MaxPool2d

池化的目的是保留特征，减少数据量；
最大池化也被称为下采样；
另外池化操作是分别应用到每一个深度切片层。输出深度与输入的深度相同。

计算

输入宽高深：H_i，W_i, D_i
滤波器宽高：f_w， f_h
S: stride，步长

输出为：
H_o = (H_i - f_h)/S + 1
W_o = (W_i - f_w)/S + 1
D_o = D_i

输入维度是 4x4x5 (HxWxD)
滤波器大小 2x2 (HxW)
stride 的高和宽都是 2 (S)

在这里插入图片描述

函数说明

官方说明
https://pytorch.org/docs/stable/generated/torch.nn.MaxPool2d.html#torch.nn.MaxPool2d

torch.nn.MaxPool2d(kernel_size, stride=None, padding=0, dilation=1, return_indices=False, ceil_mode=False)

ceil_mode，超出范围时是否计算

代码实现

import torch
import torch.nn as nn# MaxPool2d 函数 input 需要是 4维
ip = torch.reshape(t1, (-1, 1, 5, 5))class Net(nn.Module):def __init__(self):super(Net, self).__init__()self.maxpool = nn.MaxPool2d(kernel_size=3, ceil_mode=True)
#         self.maxpool = nn.MaxPool2d(kernel_size=3, ceil_mode=False)def forward(self, input):output = self.maxpool(input)return outputnet = Net()
ret = net(ip)
ret# tensor([[[[2., 3.], [5., 1.]]]])  # ceil_mode=True
# tensor([[[[2.]]]])  # ceil_mode=False

数据集中调用

import torchvision
from torch.utils.data import DataLoader
from torch.utils.tensorboard import SummaryWriterdata_path = '/xxxx/cifar10'
datasets = torchvision.datasets.CIFAR10(data_path, train=False, download=True, transform=torchvision.transforms.ToTensor())data_loader = DataLoader(datasets, batch_size=64)class Net(nn.Module):def __init__(self):super(Net, self).__init__()self.maxpool1 = nn.MaxPool2d(kernel_size=3, ceil_mode=False)
#         self.maxpool = nn.MaxPool2d(kernel_size=3, ceil_mode=False)def forward(self, input):output = self.maxpool1(input)return outputwriter = SummaryWriter('logs_maxpool1')
step = 0
net = Net()
for data in data_loader:imgs, targets = datawriter.add_images('input', imgs, step)output = net(imgs) writer.add_images('output', output, step)step = step + 1writer.close()

启动 tensorboard:

tensorboard --logdir=logs_maxpool1

卷积过程动画

图片来自：https://github.com/vdumoulin/conv_arithmetic/blob/master/README.md

Transposed convolution animations

No padding, no strides
请添加图片描述

Arbitrary padding, no strides

请添加图片描述

Half padding, no strides
请添加图片描述

Full padding, no strides

请添加图片描述

No padding, strides

请添加图片描述

Padding, strides

请添加图片描述

Padding, strides (odd)

请添加图片描述

Transposed convolution animations

No padding, no strides, transposed

请添加图片描述

Arbitrary padding, no strides, transposed

请添加图片描述

Half padding, no strides, transposed

请添加图片描述

Full padding, no strides, transposed

请添加图片描述

No padding, strides, transposed
请添加图片描述

Padding, strides, transposed
请添加图片描述

Padding, strides, transposed (odd)

请添加图片描述

PyTorch - Conv2d 和 MaxPool2d

文章目录Conv2d计算Conv2d 函数解析代码示例MaxPool2d计算函数说明卷积过程动画Transposed convolution animationsTransposed convolution animations参考视频：土堆说卷积计算 https://www.bilibili.com/video/BV1hE411t7RN 关于 torch.nn 和 torch.nn.function t…...

编程日记 2023/2/19 5:44:53

leetcode Day2(昨天实习有点bug，心态要崩了)

int carry 0;for(int i a.size() - 1, j b.size() - 1; i > 0 || j > 0 || carry; --i, --j) {int x i < 0 ? 0 : a[i] - 0;int y j < 0 ? 0 : b[j] - 0;int sum (x y carry) % 2;carry (x y carry) / 2;str.insert(0, 1, sum 0);}return str;加一&a…...

编程日记 2023/2/19 5:43:43

另一种思考：为什么不选JPA、MyBatis，而选择JDBCTemplate

以下内容转载自：https://segmentfault.com/a/1190000018472572 作者：scherman 因为项目需要选择数据持久化框架，看了一下主要几个流行的和不流行的框架，对于复杂业务系统，最终的结论是，JOOQ是总体上最好的…...

编程日记 2023/2/19 5:42:34

LeetCode 338. 比特位计数

给你一个整数 n ，对于 0 < i < n 中的每个 i ，计算其二进制表示中 1 的个数 ，返回一个长度为 n 1 的数组 ans 作为答案。示例 1： 输入：n 2 输出：[0,1,1] 解释： 0 --> 0 1 --> …...

编程日记 2023/2/19 5:41:23

排序评估指标——NDCG和MAP

在搜索和推荐任务中，系统常返回一个item列表。如何衡量这个返回的列表是否优秀呢？ 例如，当我们检索【推荐排序】，网页返回了与推荐排序相关的链接列表。列表可能会是[A,B,C,G,D,E,F],也可能是[C,F,A,E,D]，现在问题来了…...

编程日记 2023/2/19 5:39:08

[Android Studio] Android Studio Virtual Device（AVD）虚拟机的功能试用

🟧🟨🟩🟦🟪 Android Debug🟧🟨🟩🟦🟪 Topic 发布安卓学习过程中遇到问题解决过程，希望我的解决方案可以对小伙伴们有帮助。 🚀write…...

编程日记 2023/2/19 5:38:01

kafka-3-kafka应用的核心要点和内外网访问

kafka实战教程(python操作kafka)，kafka配置文件详解 Kafka内外网访问的设置 1 kafka简介根据官网的介绍，ApacheKafka是一个分布式流媒体平台，它主要有3种功能： (1)发布和订阅消息流，这个功能类似于消息队列&#x…...

编程日记 2023/2/19 5:35:47

VS2017+OpenCV4.5.5 决策树-评估是否发放贷款

决策树是一种非参数的监督学习方法，主要用于分类和回归。决策树结构决策树在逻辑上以树的形式存在，包含根节点、内部结点和叶节点。根节点：包含数据集中的所有数据的集合内部节点：每个内部节点为一个判断条件，并且…...

编程日记 2023/2/19 5:34:39

Prometheus 记录规则和警报规则

前提环境： Docker环境涉及参考文档： Prometheus 录制规则Prometheus 警报规则语法检查规则 promtool check rules /path/to/example.rules.yml一：录制规则语法 groups 语法： groups:[ - <rule_group> ]rule_group…...

编程日记 2023/2/19 5:32:22

（API）接口测试的关键技术

接口测试也就是API测试，从名字上可以知道是面向接口的测试活动。所以在讲API测试之前，我们应该说清楚接口是什么，那么接口就是有特定输入和特定输出的一套逻辑处理单元，而对于接口调用方来说，不用知道自身的内部实现逻…...

编程日记 2023/2/19 5:31:14

快速排序算法原理 Quicksort —— 图解（精讲） JAVA

快速排序是 Java 中 sort 函数主要的排序方法，所以今天要对快速排序法这种重要算法的详细原理进行分析。思路：首先快速排序之所以高效一部分原因是利用了离散数学中的传递性。例如 1 < 2 且 2 < 3 所以可以推出 1 < 3。在快速排序的过程中巧…...

编程日记 2023/2/19 5:30:05

linux环境搭建私有gitlab仓库

搭建之前，需要安装相应的依赖包，并且要启动sshd服务(1).安装policycoreutils-python openssh-server openssh-clients [rootVM-0-2-centos ~]# sudo yum install -y curl policycoreutils-python openssh-server openssh-clients [rootVM-0-2-centos ~]…...

编程日记 2023/2/19 5:28:56

SpringSecurity授权

文章目录工具类使用自定义失败处理代码配置跨域其他权限授权hasAnyAuthority自定义权限校验方法基于配置的权限控制工具类 import javax.servlet.http.HttpServletResponse; import java.io.IOException;public class WebUtils {/*** 将字符串渲染到客户端** param response 渲…...

编程日记 2023/2/19 5:27:48

学习 Python 之 Pygame 开发坦克大战（一）

学习 Python 之 Pygame 开发坦克大战（一）Pygame什么是Pygame?初识pygame1. 使用pygame创建窗口2. 设置窗口背景颜色3. 获取窗口中的事件4. 在窗口中展示图片(1). pygame中的直角坐标系(2). 展示图片(3). 给部分区域设置颜色5. 在窗口中显示文字6. 播放音…...

编程日记 2023/2/19 5:26:39

2.5｜iot冯｜方元-嵌入式linux系统开发入门｜2.13+2.18

一、 Linux 指令操作题（共5题（共 20 分，每小题 4分）与系统工作、系统状态、工作目录、文件、目录、打包压缩与搜索等主题相关。1.文件1.1文件属性1.2文件类型属性字段的第1个字符表示文件类型，后9个字符中，…...

编程日记 2023/2/19 5:25:30

一起Talk Android吧（第四百九十六回：自定义View实例二：环形进度条）

文章目录知识回顾实现思路实现方法示例代码各位看官们大家好，上一回中咱们说的例子是"如何使用Java版MQTT客户端",这一回中咱们说的例子是"自定义View实例二：环形进度条"。闲话休提，言归正转，让我们一起Talk Android吧！知识回顾看官们，我们又回…...

编程日记 2023/2/19 5:24:21

上传图片尺寸校验

使用方法 ● Image ● URL ● onload代码： async validImageSize(file, imgWidth, imgHeight) {const img new Image()img.src URL.createObjectURL(file)const { w, h } await new Promise((resolve, reject) > {img.onload () > {const { width: w, he…...

编程日记 2023/2/19 5:23:14

【Python】缺失值处理和拉格朗日插值法（含源代码实现）

目录：缺失值处理和拉格朗日插值法一、前言二、理论知识三、代码实现一、前言对于含有缺失值的数据集，如果通过删除小部分记录达到既定的目标，那么删除含有缺失值的记录的方法是最有效的。然而，这种方法也有很多问题，…...

编程日记 2023/2/19 5:22:06

SpringCloudAlibaba-Sentinel

一、介绍官网：https://github.com/alibaba/Sentinel/下载jar包,启动,访问http://localhost:8080/创建module添加如下依赖<dependency><groupId>com.alibaba.cloud</groupId><artifactId>spring…...

编程日记 2023/2/19 5:20:58

【程序化天空盒】过程记录02：云扰动边缘光消散效果

写在前面写在前面唉，最近筋疲力竭，课题组的东西一堆没做，才刚刚开始带着思考准备练习作品，从去年5月份开始到现在真得学了快一年了，转行学其他的真的好累，，不过还是加油！ 下面是做…...

编程日记 2023/2/19 5:19:49

RestClient

什么是RestClient RestClient 是 Elasticsearch 官方提供的 Java 低级 REST 客户端，它允许HTTP与Elasticsearch 集群通信，而无需处理 JSON 序列化/反序列化等底层细节。它是 Elasticsearch Java API 客户端的基础。 RestClient 主要特点轻量级&#xff…...

编程新知 2025/11/30 15:33:36

第19节 Node.js Express 框架

Express 是一个为Node.js设计的web开发框架，它基于nodejs平台。 Express 简介 Express是一个简洁而灵活的node.js Web应用框架, 提供了一系列强大特性帮助你创建各种Web应用，和丰富的HTTP工具。使用Express可以快速地搭建一个完整功能的网站。 Expre…...

编程新知 2026/2/8 6:37:43

反向工程与模型迁移：打造未来商品详情API的可持续创新体系

在电商行业蓬勃发展的当下，商品详情API作为连接电商平台与开发者、商家及用户的关键纽带，其重要性日益凸显。传统商品详情API主要聚焦于商品基本信息（如名称、价格、库存等）的获取与展示，已难以满足市场对个性化、智能…...

编程新知 2025/9/15 5:56:53

Appium+python自动化（十六）- ADB命令

简介 Android 调试桥(adb)是多种用途的工具，该工具可以帮助你你管理设备或模拟器的状态。 adb ( Android Debug Bridge)是一个通用命令行工具，其允许您与模拟器实例或连接的 Android 设备进行通信。它可为各种设备操作提供便利，如安装和调试…...

编程新知 2026/1/21 18:20:51

.Net框架，除了EF还有很多很多......

文章目录 1. 引言2. Dapper2.1 概述与设计原理2.2 核心功能与代码示例基本查询多映射查询存储过程调用 2.3 性能优化原理2.4 适用场景 3. NHibernate3.1 概述与架构设计3.2 映射配置示例Fluent映射XML映射 3.3 查询示例HQL查询Criteria APILINQ提供程序 3.4 高级特性3.5 适用场…...

编程新知 2026/2/1 19:26:16

java 实现excel文件转pdf | 无水印 | 无限制

文章目录目录文章目录前言 1.项目远程仓库配置 2.pom文件引入相关依赖 3.代码破解二、Excel转PDF 1.代码实现 2.Aspose.License.xml 授权文件总结前言 java处理excel转pdf一直没找到什么好用的免费jar包工具，自己手写的难度，恐怕高级程序员花费一年的事件，也…...

编程新知 2025/11/5 4:10:42

vscode（仍待补充）

写于2025 6.9 主包将加入vscode这个更权威的圈子 vscode的基本使用侧边栏 vscode还能连接ssh？ debug时使用的launch文件 1.task.json {"tasks": [{"type": "cppbuild","label": "C/C: gcc.exe 生成活动文件"…...

编程新知 2026/1/24 13:04:10

关于nvm与node.js

1 安装nvm 安装过程中手动修改 nvm的安装路径， 以及修改通过nvm安装node后正在使用的node的存放目录【这句话可能难以理解，但接着往下看你就了然了】 2 修改nvm中settings.txt文件配置 nvm安装成功后，通常在该文件中会出现以下配置&…...

编程新知 2026/1/28 15:17:32

【2025年】解决Burpsuite抓不到https包的问题

环境：windows11 burpsuite:2025.5 在抓取https网站时，burpsuite抓取不到https数据包，只显示： 解决该问题只需如下三个步骤： 1、浏览器中访问 http://burp 2、下载 CA certificate 证书 3、在设置--隐私与安全--…...

编程新知 2026/1/28 3:43:20

linux 下常用变更-8

1、删除普通用户查询用户初始UID和GIDls -l /home/ ###家目录中查看UID cat /etc/group ###此文件查看GID删除用户1.编辑文件 /etc/passwd 找到对应的行，YW343:x:0:0::/home/YW343:/bin/bash 2.将标红的位置修改为用户对应初始UID和GID： YW3…...

编程新知 2025/10/7 15:08:22

文章目录

Conv2d

计算

Conv2d 函数解析

代码示例

MaxPool2d

计算

函数说明

卷积过程动画

Transposed convolution animations

Transposed convolution animations

相关文章：