当前位置：首页 > news >正文

机器学习之过采样和下采样调整不均衡样本的逻辑回归模型

news 2026/3/29 11:27:28

过采样和下采样调整不均衡样本的逻辑回归模型

过采样和下采样调整不均衡样本的逻辑回归模型
- 1 过采样
- - 1.1 样本不均衡
  - 1.2 概念
  - 1.3 图片理解
  - 1.4 SMOTE算法
  - 1.5 算法导入
  - 1.6 函数及格式
  - 1.7 样本类别可视化理解
- 2 下采样
- - 2.1 概念
  - 2.2 图片理解
  - 2.3 数据处理理解
  - 2.4 样本类别可视化理解
- 3 实际调整模型

1 过采样

1.1 样本不均衡

数据集中不同类别的样本数量差异很大，通常表现为一个类别的样本数量远多于其他类别。

1.2 概念

增加少数类的样本数量，使其样本多的类别样本数量相同。

1.3 图片理解

在这里插入图片描述

1.4 SMOTE算法

在这里插入图片描述

1.5 算法导入

from imblearn.over_sampling import SMOTE

1.6 函数及格式

ov = SMOTE(random_state=0)，随机抽取函数

random_state是随机种子，保证同一数字时随机抽取数据相同

x_ov,y_ov = ov.fit_resample(x_tr_all,y_tr_all)，
- x_ov经过随机抽取，自动拟合后数据,y_ov
- x_tr_all,y_tr_all

1.7 样本类别可视化理解

import matplotlib.pyplot as plt
import pandas as pd
import numpy as np
from sklearn.linear_model import LogisticRegression
from sklearn.model_selection import train_test_split, cross_val_predict, cross_val_score
from sklearn.preprocessing import StandardScaler
from sklearn import metrics
from sklearn.metrics import confusion_matrix
import pylab as mpl# 标准化处理
scaler = StandardScaler()
data = pd.read_csv('creditcard.csv')
a = data[['Amount']]
b = data['Amount']
# z标准化处理Amount，再存Amount中
data['Amount'] = scaler.fit_transform(data[['Amount']])
# 删除time列
data = data.drop(['Time'],axis=1)
# 特征数据x,删除class列
x_all = data.drop(['Class'],axis=1)
# class为标签结果列
y_all = data.Class
# # 训练集特征，测试集特征,训练集结果，测试集结果,test_size抽取的测试集百分比，train_size 抽取的训练集百分比
x_tr_all,x_te_all,y_tr_all,y_te_all = \train_test_split(x_all,y_all, test_size=0.2,random_state=1000)
# 样本不均衡图片
mpl.rcParams['font.sans-serif']=['Microsoft YaHei']
mpl.rcParams['axes.unicode_minus']=False
labels_count = pd.value_counts(y_all)
plt.title('正负样本数1')
plt.xlabel('类别')
plt.ylabel('频数')
labels_count.plot(kind='bar')
plt.show()
# #过采样使样本均衡
from imblearn.over_sampling import SMOTE
ov = SMOTE(random_state=0)
x_tr_ov,y_tr_ov = ov.fit_resample(x_tr_all,y_tr_all)
# 交叉验证
scores = []
c_range = [0.01,0.1,1,10,100]
# 均衡样本正负图像显示
mpl.rcParams['font.sans-serif']=['Microsoft YaHei']
mpl.rcParams['axes.unicode_minus']=False
labels_count = pd.value_counts(y_tr_ov)
plt.title('正负样本数')
plt.xlabel('类别')
plt.ylabel('频数')
labels_count.plot(kind='bar')
plt.show()

在这里插入图片描述

2 下采样

2.1 概念

减少多数类的样本数量，使其样本少的类别样本数量相同，但可能会丢失重要信息。

2.2 图片理解

在这里插入图片描述

2.3 数据处理理解

pt_eg = **data_tr[data_tr[‘Class’] == 0]**找出两类数据
ng_eg = data_tr[data_tr[‘Class’] == 1]
pt_eg = pt_eg.sample(len(ng_eg)) ，根据少的数据对多的数据进行抽取
data_c = pd.concat([pt_eg,ng_eg])，再将两类数据合并

2.4 样本类别可视化理解

代码展示：

import matplotlib.pyplot as plt
import pandas as pd
import numpy as np
from numpy.random import sample
from sklearn.model_selection import train_test_split, cross_val_predict, cross_val_score
from sklearn.preprocessing import StandardScaler
from sklearn import metrics
import pylab as mpl# 标准化处理
scaler = StandardScaler()
data = pd.read_csv('creditcard.csv')
a = data[['Amount']]
b = data['Amount']
# z标准化处理Amount，再存Amount中
data['Amount'] = scaler.fit_transform(data[['Amount']])
# 删除time列
data = data.drop(['Time'],axis=1)
# 特征数据x,删除class列
x_all = data.drop(['Class'],axis=1)
# class为标签结果列
y_all = data.Class
# # 训练集特征，测试集特征,训练集结果，测试集结果,test_size抽取的测试集百分比，train_size 抽取的训练集百分比
x_tr_all,x_te_all,y_tr_all,y_te_all = \train_test_split(x_all,y_all, test_size=0.2,random_state=1000)
# 样本不均衡
mpl.rcParams['font.sans-serif']=['Microsoft YaHei']
mpl.rcParams['axes.unicode_minus']=False
labels_count = pd.value_counts(y_all)
plt.title('正负样本数1')
plt.xlabel('类别')
plt.ylabel('频数')
labels_count.plot(kind='bar')
plt.show()
#下采样
## 组合，为后准备，两个表格组合，前datafarme,后serise,添加列，直接赋值
np.random.seed(seed=4)
# 随机种子
x_tr_all['Class'] = y_tr_all
data_tr = x_tr_all
pt_eg = data_tr[data_tr['Class'] == 0]
ng_eg = data_tr[data_tr['Class'] == 1]
pt_eg = pt_eg.sample(len(ng_eg))
data_c = pd.concat([pt_eg,ng_eg])
x_data_c = data_c.drop(['Class'],axis=1)
y_data_c = data_c['Class']
mpl.rcParams['font.sans-serif']=['Microsoft YaHei']
mpl.rcParams['axes.unicode_minus']=False
labels_count = pd.value_counts(y_data_c )
plt.title('正负样本数1')
plt.xlabel('类别')
plt.ylabel('频数')
labels_count.plot(kind='bar')
plt.show()

在这里插入图片描述

3 实际调整模型

不均衡样本，下采样样本，过采样样本训练模型代码及结果，可以明显看到数据召回率上升。

代码展示：

import time
import matplotlib.pyplot as plt
import pandas as pd
import numpy as np
from numpy.random import sample
from sklearn.linear_model import LogisticRegression
from sklearn.model_selection import train_test_split, cross_val_predict, cross_val_score
from sklearn.preprocessing import StandardScaler
from sklearn import metrics
from sklearn.model_selection import cross_val_score
from sklearn.metrics import confusion_matrix
import pylab as mpl
# 标准化处理
scaler = StandardScaler()
data = pd.read_csv('creditcard.csv')
a = data[['Amount']]
b = data['Amount']
# z标准化处理Amount，再存Amount中
data['Amount'] = scaler.fit_transform(data[['Amount']])
# 删除time列
data = data.drop(['Time'],axis=1)
# 特征数据x,删除class列
x_all = data.drop(['Class'],axis=1)
# class为标签结果列
y_all = data.Class
# # 训练集特征，测试集特征,训练集结果，测试集结果,test_size抽取的测试集百分比，train_size 抽取的训练集百分比
x_tr_all,x_te_all,y_tr_all,y_te_all = \train_test_split(x_all,y_all, test_size=0.2,random_state=1000)
# 样本不均衡
scores = []
c_range = [0.01,0.1,1,10,100]
## 循环测试带入因子
for i in c_range:start_time = time.time()lg = LogisticRegression(C=i,penalty='l2',solver='lbfgs',max_iter=1000)# 模型迭代8次后的所有模型的recall值score = cross_val_score(lg,x_tr_all,y_tr_all,cv=5,scoring='recall')# score的平均值，也就是recall的平均值score_m = sum(score)/len(score)# scores列表添加均值recallscores.append(score_m)end_time = time.time()
best_c = c_range[np.argmax(scores)]
lg = LogisticRegression(C=best_c,penalty='l2',max_iter=1000)
lg.fit(x_te_all,y_te_all)
te_pr = lg.predict(x_te_all)
print("不均衡样本训练")
print(metrics.classification_report(y_te_all,te_pr))# 下采样
np.random.seed(seed=4)
x_tr_all['Class'] = y_tr_all
data_tr = x_tr_all
pt_eg = data_tr[data_tr['Class'] == 0]
ng_eg = data_tr[data_tr['Class'] == 1]
pt_eg = pt_eg.sample(len(ng_eg))
data_c = pd.concat([pt_eg,ng_eg])
x_data_c = data_c.drop(['Class'],axis=1)
# class为标签结果列
y_data_c = data_c.Class
# # 交叉验证
scores = []
c_range = [0.01,0.1,1,10,100]
# 循环测试带入因子
for i in c_range:lg = LogisticRegression(C=i,penalty='l2',solver='lbfgs',max_iter=1000)# 模型迭代8次后的所有模型的recall值score = cross_val_score(lg,x_data_c,y_data_c,cv=5,scoring='recall')# score的平均值，也就是recall的平均值score_m = sum(score)/len(score)# scores列表添加均值recallscores.append(score_m)
best_c = c_range[np.argmax(scores)]
# 根据上面最大判断，建立模型
lg = LogisticRegression(C=best_c,penalty='l2',max_iter=1000)
lg.fit(x_data_c,y_data_c)
te_pr = lg.predict(x_te_all)
print("下采样均衡样本训练")
print(metrics.classification_report(y_te_all,te_pr))# #过采样
scaler = StandardScaler()
data = pd.read_csv('creditcard.csv')
a = data[['Amount']]
b = data['Amount']
# z标准化处理Amount，再存Amount中
data['Amount'] = scaler.fit_transform(data[['Amount']])
# 删除time列
data = data.drop(['Time'],axis=1)
# 特征数据x,删除class列
x_all = data.drop(['Class'],axis=1)
# class为标签结果列
y_all = data.Class
x_tr_all,x_te_all,y_tr_all,y_te_all = \train_test_split(x_all,y_all, test_size=0.2,random_state=1000)
from imblearn.over_sampling import SMOTE
ov = SMOTE(random_state=0)
x_tr_ov,y_tr_ov = ov.fit_resample(x_tr_all,y_tr_all)
# 交叉验证
scores = []
c_range = [0.01,0.1,1,10,100]
## 循环测试带入因子
for i in c_range:# start_time = time.time()lg = LogisticRegression(C=i,penalty='l2',solver='lbfgs',max_iter=1000)# 模型迭代8次后的所有模型的recall值score = cross_val_score(lg,x_tr_ov,y_tr_ov,cv=5,scoring='recall')# score的平均值，也就是recall的平均值score_m = sum(score)/len(score)# scores列表添加均值recallscores.append(score_m)
best_c = c_range[np.argmax(scores)]
lg = LogisticRegression(C=best_c,penalty='l2',max_iter=1000)
lg.fit(x_tr_ov,y_tr_ov)
te_pr1 = lg.predict(x_te_all)
print("过采样均衡样本训练")
print(metrics.classification_report(y_te_all,te_pr1))

运行结果：
在这里插入图片描述

机器学习之过采样和下采样调整不均衡样本的逻辑回归模型

过采样和下采样调整不均衡样本的逻辑回归模型目录过采样和下采样调整不均衡样本的逻辑回归模型1 过采样1.1 样本不均衡1.2 概念1.3 图片理解1.4 SMOTE算法1.5 算法导入1.6 函数及格式1.7 样本类别可视化理解 2 下采样2.1 概念2.2 图片理解2.3 数据处理理解2.4 样本类别可视化…...

编程日记 2025/1/5 14:13:30

解决 ssh connect to host github.com port 22 Connection timed out

一、问题描述本地 pull/push 推送代码到 github 项目报 22 端口连接超时，测试连接也是 22 端口连接超时 ssh 密钥没问题、也开了 Watt Toolkit 网络是通的，因此可以强制将端口切换为 443 二、解决方案 1、测试连接 ssh -T gitgithub.com意味着无法通…...

编程日记 2025/1/5 14:09:27

mybatis/mybatis-plus中mysql报错

文章目录一、sql执行正常,mybatis报错二、sql执行正常,mybatis-plus报错直接改变字段利用mybatis-plus特性处理总结一、sql执行正常,mybatis报错 Caused by: net.sf.jsqlparser.parser.ParseException: Encountered unexpected token: "ur" <K_ISOLATION>a…...

编程日记 2025/1/5 14:05:21

在ros2 jazzy和gazebo harmonic下的建图导航（cartographer和navigation）实现（基本）

我的github分支！！！ 你可以在这里找到相对应的源码。 DWDROME的MOGI分支来源于！！ MOGI-ROS/Week-3-4-Gazebo-basics 学习分支整理日志分支概述这是一个用于个人学习的新分支，目的是扩展基本模型并添加…...

编程日记 2025/1/5 13:59:14

《Rust权威指南》学习笔记（五）

高级特性 1.在Rust中，unsafe是一种允许绕过Rust的安全性保证的机制，用于执行一些Rust默认情况下不允许的操作。unsafe存在的原因是：unsafe 允许执行某些可能被 Rust 的安全性检查阻止的操作，从而可以进行性能优化，如手…...

编程日记 2025/1/5 13:56:10

GitHub的简单操作

引言今天开始就要开始做项目了，上午是要把git搭好。搭的过程中遇到好多好多的问题。下面就说一下git的简单操作流程。我们是使用的GitHub,下面也就以这个为例了一、GitHub账号的登录注册 https://github.com/ 通过这个网址可以来到GitHub首页点击中间绿色的S…...

编程日记 2025/1/5 13:55:09

「Mac畅玩鸿蒙与硬件54」UI互动应用篇31 - 滑动解锁屏幕功能

本篇教程将实现滑动解锁屏幕功能，通过 Slider 组件实现滑动操作，学习事件监听、状态更新和交互逻辑的实现方法。关键词滑动解锁UI交互状态管理动态更新事件监听一、功能说明滑动解锁屏幕功能包含以下功能： 滑动解锁区域：用…...

编程日记 2025/1/5 13:53:07

SMMU软件指南之系统架构考虑

安全之安全(security)博客目录导读目录 5.1 I/O 一致性 5.2 客户端设备 5.2.1 地址大小 5.2.2 缓存 5.3 PCIe 注意事项 5.3.1 点对点通信 5.3.2 No_snoop 5.3.3 ATS 5.4 StreamID 分配 5.5 MSI 本博客介绍与 SMMU 相关的一些系统架构注意事项。 5.1 I/O 一致性如…...

编程日记 2025/1/5 13:49:03

使用高云小蜜蜂GW1N-2实现MIPI到LVDS（DVP）转换案例分享

作者：Hello，Panda 大家晚上好，熊猫君又来了。今天要分享的是一个简单的MIPI到LVDS（DVP）接口转换的案例。目的就是要把低成本FPGA的应用潜力充分利用起来。一、应用背景这个案例的应用背景是：现在还在…...

编程日记 2025/1/5 13:48:01

「C++笔记」unordered_map：哈希化的无序映射函数（键值对）

unordered_map 是 C 中一个经过哈希函数（Hash）处理的映射（map）容器。本文中的map和set是差不多的，unordered_map与unordered_set也是对应的。所以不再单独写一篇了。这里的内容建议看完本文之后再回过头来看二者虽然…...

编程日记 2025/1/5 13:43:57

Linux 安装jdk

1、官网下载jdk https://www.oracle.com/java/technologies/javase/javase8-archive-downloads.html2、以tar包为例，在window或者Linux解压都可以，这里直接在win解压了，上传到服务器 3、在/usr/local/ 创建jdk目录，将jdk上传到…...

编程日记 2025/1/5 13:42:57

asp.net core 发布到iis后，一直500.19，IIS设置没问题，安装了sdk，文件夹权限都有，还是报错

原因就是没有安装ASP.NET Core 9.0 Runtime (v9.0.0) - Windows Hosting Bundle，我是只安装了.net core的sdk，下面介绍下sdk和hosting bundle的关系在 .NET Core 和 ASP.NET Core 的开发中，SDK（Software Development Kit&#x…...

编程日记 2025/1/5 13:41:55

【Go】运行自己的第一个Go程序

运行自己的第一个Go程序一、Go语言的安装Go环境安装查看是否安装成功配置GOPROXY(代理) 二、Goland安装三、Goland破解四、新建项目开一篇专栏记录学习Go的过程，一门新语言从hello world开始，这篇文章详细讲解Go语言环境搭建及hello world实现一、Go语…...

编程日记 2025/1/5 13:40:53

qt qss文件的使用

qt样式的修改方式一通过ui界面的改变样式表来直接修改显示效果。不推荐，其他人不好修改，不够直观，不易维护。二通过setStyleSheet接口修改。一般，界面很少的时候可以使用。一旦界面多起来，代码部分就显得杂乱…...

编程日记 2025/1/5 13:35:48

【管道——二分+区间合并】

题目思路区间合并 1、按照左端点排序2、遍历窗口，若窗口非法，继续遍历；否则执行33、若是第一个窗口，设定合并结果初值，判断结果左端点是否造成“起点过大”，是，FALSE退出；否则执行…...

编程日记 2025/1/5 13:34:47

宽带、光猫、路由器、WiFi、光纤之间的关系

1、宽带（Broadband） 1.1 宽带的定义宽带指的是一种高速互联网接入技术，通常包括ADSL、光纤、4G/5G等不同类型的接入方式。宽带的关键特点是能够提供较高的数据传输速率，使得用户可以享受到稳定的上网体验。 1.2 宽带的作用宽带是…...

编程日记 2025/1/5 13:32:45

如何排查 Apache Doris 中 “Failed to commit txn“ 导入失败问题？

今天来聊聊 Doris 数据导入那些事儿。你是不是在数据导入的时候遇到各种状况，让人头疼不已？别担心，这篇文章给你答案！ 在 Doris 的版本里，< 2.0.3 的时候，数据迁移存在一些已知的问题，比如可…...

编程日记 2025/1/5 13:29:41

回归预测 | MATLAB实现CNN-GRU卷积门控循环单元多输入单输出回归预测

回归预测 | MATLAB实现CNN-GRU卷积门控循环单元多输入单输出回归预测目录回归预测 | MATLAB实现CNN-GRU卷积门控循环单元多输入单输出回归预测预测效果基本介绍程序设计参考资料预测效果基本介绍 MATLAB实现CNN-GRU卷积门控循环单元多输入单输出回归预测数据准备&#x…...

编程日记 2025/1/5 13:28:38

HCIA-Access V2.5_7_3_XG(S)原理_关键技术

为什么需要测距因为上行链路只有一根纤，而且每一个ONU到OLT的距离是不一样的，虽然上行通过TDMA技术，让每一个ONU在不同的时间段发送数据，但是仍然有可能在同一时刻到达分光器，产生数据冲突。有测距的信元传输所以为了避免碰撞冲突，通过ONU在注册的时候就会启动测距…...

编程日记 2025/1/5 13:27:36

leetcode hot 100 不同路径

62. 不同路径已解答中等相关标签相关企业一个机器人位于一个 m x n 网格的左上角 （起始点在下图中标记为 “Start” ）。机器人每次只能向下或者向右移动一步。机器人试图达到网格的右下角（在下图中标记为 “Finish” &#xff09…...

编程日记 2025/1/5 13:26:35

AtlasOS：终极Windows系统性能优化与隐私保护指南

AtlasOS：终极Windows系统性能优化与隐私保护指南【免费下载链接】Atlas 🚀 An open and lightweight modification to Windows, designed to optimize performance, privacy and security. 项目地址: https://gitcode.com/GitHub_Trending/atlas1/Atl…...

编程新知 2026/3/29 10:53:04

革命性超分辨率突破：OptiScaler让任何显卡实现4K级画质与帧率双提升

革命性超分辨率突破：OptiScaler让任何显卡实现4K级画质与帧率双提升【免费下载链接】OptiScaler DLSS replacement for AMD/Intel/Nvidia cards with multiple upscalers (XeSS/FSR2/DLSS) 项目地址: https://gitcode.com/GitHub_Trending/op/OptiScaler 在…...

编程新知 2026/3/29 10:47:00

零基础入门：PyTorch-2.x-Universal-Dev-v1.0环境使用避坑指南

零基础入门：PyTorch-2.x-Universal-Dev-v1.0环境使用避坑指南 1. 环境介绍与快速验证 PyTorch-2.x-Universal-Dev-v1.0是一个专为深度学习开发者设计的预配置环境，基于官方PyTorch底包构建，已经集成了常用的数据处理、可视化和开发工具。这…...

编程新知 2026/3/29 9:36:08

UI-TARS-desktop作品集：从简单指令到复杂工作流，看AI如何帮你干活

UI-TARS-desktop作品集：从简单指令到复杂工作流，看AI如何帮你干活 1. 引言：当AI成为你的数字同事想象一下，你每天上班要处理一堆重复性的电脑操作：打开邮箱、下载附件、整理数据、生成报告、发送邮件……这些工作繁…...

编程新知 2026/3/29 9:30:04

革新性B站用户分析工具：智能解析评论区用户背景的终极方案

革新性B站用户分析工具：智能解析评论区用户背景的终极方案【免费下载链接】bilibili-comment-checker B站评论区自动标注成分，支持动态和关注识别以及手动输入 UID 识别项目地址: https://gitcode.com/gh_mirrors/bil/bilibili-comment-checker …...

编程新知 2026/3/29 8:57:59

如何解决健康160抢号难题？智能工具91160-cli让挂号效率提升5倍

如何解决健康160抢号难题？智能工具91160-cli让挂号效率提升5倍【免费下载链接】91160-cli 健康160全自动挂号脚本项目地址: https://gitcode.com/gh_mirrors/91/91160-cli 你是否曾遇到预约专家号时页面卡顿，等刷新完成号源已被抢空&#xff1f…...

编程新知 2026/3/29 8:55:58