当前位置：首页 > news >正文

机器学习必修课 - 使用管道 Pipeline

news 2025/10/15 4:43:21

目标：学习使用管道（pipeline）来提高机器学习代码的效率。

1. 运行环境：Google Colab

import pandas as pd
from sklearn.model_selection import train_test_split

!git clone https://github.com/JeffereyWu/Housing-prices-data.git

下载数据集

2. 加载房屋价格数据集，进行数据预处理，并将数据划分为训练集和验证集

# Read the data
X_full = pd.read_csv('/content/Housing-prices-data/train.csv', index_col='Id')
X_test_full = pd.read_csv('/content/Housing-prices-data/test.csv', index_col='Id')# Remove rows with missing target, separate target from predictors
X_full.dropna(axis=0, subset=['SalePrice'], inplace=True)
y = X_full.SalePrice
X_full.drop(['SalePrice'], axis=1, inplace=True)# Break off validation set from training data
X_train_full, X_valid_full, y_train, y_valid = train_test_split(X_full, y, train_size=0.8, test_size=0.2,random_state=0)

使用Pandas的read_csv函数从指定路径读取训练集和测试集的CSV文件。index_col='Id'表示将数据集中的’Id’列作为索引列。
从X_full数据中删除了带有缺失目标值的行，这是因为目标值（‘SalePrice’）是我们要预测的值，所以必须确保每个样本都有一个目标值。然后，将目标值从X_full数据中分离出来，存储在变量y中，并从X_full中删除了目标值列，以便将其视为预测特征。

3. 选择具有相对低基数（唯一值数量较少）的分类（categorical）列

# "Cardinality" means the number of unique values in a column
# Select categorical columns with relatively low cardinality (convenient but arbitrary)
categorical_cols = [cname for cname in X_train_full.columns ifX_train_full[cname].nunique() < 10 and X_train_full[cname].dtype == "object"]

识别具有相对较少不同类别的分类列，因为这些列更适合进行独热编码，而不会引入太多的新特征。

4. 选择数值型（numerical）列

# Select numerical columns
numerical_cols = [cname for cname in X_train_full.columns if X_train_full[cname].dtype in ['int64', 'float64']]

识别数据集中包含数值数据的列，因为这些列通常用于构建数值特征，并且需要用于训练和评估数值型机器学习模型。

5. 将数据集中的列限制在所选的分类（categorical）列和数值（numerical）列上

# Keep selected columns only
my_cols = categorical_cols + numerical_cols
X_train = X_train_full[my_cols].copy()
X_valid = X_valid_full[my_cols].copy()
X_test = X_test_full[my_cols].copy()

创建了一个名为my_cols的列表，其中包含了要保留的列名
使用X_train_full[my_cols].copy()和X_valid_full[my_cols].copy()从原始训练数据集（X_train_full和X_valid_full）中创建了新的数据集（X_train和X_valid）。这两个数据集只包含了my_cols中列名所对应的列，其他列被丢弃了。最后，同样的操作也被应用到测试数据集上，创建了包含相同列的测试数据集X_test。

from sklearn.compose import ColumnTransformer
from sklearn.pipeline import Pipeline
from sklearn.impute import SimpleImputer
from sklearn.preprocessing import OneHotEncoder
from sklearn.ensemble import RandomForestRegressor
from sklearn.metrics import mean_absolute_error

6. 准备数值型数据和分类型数据以供机器学习模型使用

# Preprocessing for numerical data
numerical_transformer = SimpleImputer(strategy='constant')# Preprocessing for categorical data
categorical_transformer = Pipeline(steps=[('imputer', SimpleImputer(strategy='most_frequent')),('onehot', OneHotEncoder(handle_unknown='ignore'))
])# Bundle preprocessing for numerical and categorical data
preprocessor = ColumnTransformer(transformers=[('num', numerical_transformer, numerical_cols),('cat', categorical_transformer, categorical_cols)])

创建了一个名为numerical_transformer的预处理器，用于处理数值型数据。在这里，使用了SimpleImputer，并设置了策略为’constant’，表示将缺失的数值数据填充为一个常数值。
使用SimpleImputer来填充缺失值，策略为’most_frequent’，表示使用出现频率最高的值来填充缺失的分类数据。
使用OneHotEncoder来执行独热编码，将分类数据转换成二进制的形式，并且设置了handle_unknown='ignore'，以处理在转换过程中遇到未知的分类值。
使用ColumnTransformer来组合数值型和分类型数据的预处理器，将它们一起构建成一个整体的预处理过程。

7. 建立、训练和评估一个随机森林回归模型

# Define model
model = RandomForestRegressor(n_estimators=100, random_state=0)# Bundle preprocessing and modeling code in a pipeline
clf = Pipeline(steps=[('preprocessor', preprocessor),('model', model)])# Preprocessing of training data, fit model 
clf.fit(X_train, y_train)# Preprocessing of validation data, get predictions
preds = clf.predict(X_valid)print('MAE:', mean_absolute_error(y_valid, preds))

创建了一个名为model的机器学习模型。在这里，使用了随机森林回归模型，它是一个基于决策树的集成学习模型，包含了100颗决策树，并设置了随机种子random_state为0，以确保结果的可重复性。
创建了一个名为clf的机器学习管道（Pipeline）。管道将数据预处理步骤（preprocessor）和模型训练步骤（model）捆绑在一起，确保数据首先被预处理，然后再用于模型训练。
MAE是一种衡量模型预测误差的指标，其值越小表示模型的性能越好。

MAE: 17861.780102739725

8. 重新进行数据预处理和定义一个机器学习模型

# Preprocessing for numerical data
numerical_transformer = SimpleImputer(strategy='constant')# Preprocessing for categorical data
categorical_transformer = Pipeline(steps=[('imputer', SimpleImputer(strategy='constant')),('onehot', OneHotEncoder(handle_unknown='ignore'))
])# Bundle preprocessing for numerical and categorical data
preprocessor = ColumnTransformer(transformers=[('num', numerical_transformer, numerical_cols),('cat', categorical_transformer, categorical_cols)])# Define model
model = RandomForestRegressor(n_estimators=100, random_state=0)

使用SimpleImputer来填充分类型数据中的缺失值，策略改为’constant’，改用常数值填充。

# Bundle preprocessing and modeling code in a pipeline
my_pipeline = Pipeline(steps=[('preprocessor', preprocessor),('model', model)])# Preprocessing of training data, fit model 
my_pipeline.fit(X_train, y_train)# Preprocessing of validation data, get predictions
preds = my_pipeline.predict(X_valid)# Evaluate the model
score = mean_absolute_error(y_valid, preds)
print('MAE:', score)

MAE: 17621.3197260274

9. 再一次进行数据预处理和定义一个机器学习模型

# 自定义数值型数据的预处理步骤
numerical_transformer = Pipeline(steps=[('imputer', SimpleImputer(strategy='mean')),  # 可以使用均值填充缺失值
])# 自定义分类型数据的预处理步骤
categorical_transformer = Pipeline(steps=[('imputer', SimpleImputer(strategy='most_frequent')),  # 使用最频繁的值填充缺失值('onehot', OneHotEncoder(handle_unknown='ignore'))  # 执行独热编码
])# 定义自己的模型
model = RandomForestRegressor(n_estimators=200, random_state=42)  # 增加决策树数量，设置随机种子# 将自定义的预处理和模型捆绑在一起
clf = Pipeline(steps=[('preprocessor', preprocessor),('model', model)])# 预处理训练数据，训练模型
clf.fit(X_train, y_train)# 预处理验证数据，获取预测结果
preds = clf.predict(X_valid)print('MAE:', mean_absolute_error(y_valid, preds))

MAE: 17468.0611130137

# Preprocessing of test data, fit model
preds_test = clf.predict(X_test)

# Save test predictions to file
output = pd.DataFrame({'Id': X_test.index,'SalePrice': preds_test})
output.to_csv('submission.csv', index=False)

机器学习必修课 - 使用管道 Pipeline

目标：学习使用管道（pipeline）来提高机器学习代码的效率。 1. 运行环境：Google Colab import pandas as pd from sklearn.model_selection import train_test_split!git clone https://github.com/JeffereyWu/Housing-prices-dat…...

编程日记 2023/10/7 5:44:48

WEB各类常用测试工具

一、单元测试/测试运行器 1、Jest 知名的 Java 单元测试工具，由 Facebook 开源，开箱即用。它在最基础层面被设计用于快速、简单地编写地道的 Java 测试，能自动模拟 require() 返回的 CommonJS 模块，并提供了包括内置的测试环境 …...

编程日记 2023/10/7 5:43:47

Naive UI 文档地址

最近几天官网访问不了，自己用github pages 部署了个官网 github pages...

编程日记 2023/10/7 5:42:45

在CentOS7系统中安装MySQL5.7

第一步：下载MySQL包 > wget http://repo.mysql.com/mysql57-community-release-el7-10.noarch.rpm第二步：安装MySQL源 > rpm -Uvh mysql57-community-release-el7-10.noarch.rpm第三步：安装MySQL服务端 > yum install -y mysql-c…...

编程日记 2023/10/7 5:39:43

R语言通过接口获取网上数据平台的免费数据

大家好，我是带我去滑雪！ 作为一名统计学专业的学生，时常和数据打交道，我深知数据的重要性。数据是实证研究的重要基础，每当在完成一篇科研论文中的实证研究部分时，我都能深刻体会实证研究最复杂、最耗时的工…...

编程日记 2023/10/7 5:38:42

【Docker内容大集合】Docker从认识到实践再到底层原理大汇总

前言那么这里博主先安利一些干货满满的专栏了！ 首先是博主的高质量博客的汇总，这个专栏里面的博客，都是博主最最用心写的一部分，干货满满，希望对大家有帮助。高质量博客汇总https://blog.csdn.net/yu_cblog/categ…...

编程日记 2023/10/7 5:37:41

算法题：摆动序列

这道题是一道贪心算法题，如果前两个数是递增，则后面要递减，如果不符合则往后遍历，直到找到符合的。（完整题目附在了最后） 代码如下： class Solution(object):def wiggleMaxLength(self, nums):…...

编程日记 2023/10/7 5:36:41

复习 --- QT服务器客户端

服务器： 头文件： #ifndef WIDGET_H #define WIDGET_H#include <QWidget> #include<QTcpServer> #include<QTcpSocket> #include<QMessageBox> #include<QDebug> #include<QList> #include<QListWidget> #in…...

编程日记 2023/10/7 5:35:40

Godot 官方2D游戏笔记(1)：导入动画资源和添加节点

前言 Godot 官方给了我们2D游戏和3D游戏的案例，不过如果是独立开发者只用考虑2D游戏就可以了，因为2D游戏纯粹，我们只需要关注游戏的玩法即可。2D游戏的美术素材简单，交互逻辑简单，我们可以把更多的时间放在游戏的玩法…...

编程日记 2023/10/7 5:34:39

leetcode 热题 100

数组和字符串匹配子串和子序列原串：“abcabc” 子串：“abc”, 连续但不大于原串的字符串子序列：“acc”, 字符来自原串且保持在原串中顺序不变的字符串子排列： “aabbcc”, 字符来自原串且只能用1次,但可有不同排列顺序的字…...

编程日记 2023/10/7 5:33:38

Ae 效果：CC Lens

扭曲/CC Lens Distort/CC Lens CC Lens （CC 镜头）主要用于添加或移除摄像机镜头扭曲，比如桶形失真 Barrel、枕形失真 Pincushion以及鱼眼失真 Fisheye等。或者，用它来创建一些特殊的动画效果。 ◆ ◆ ◆ 效果属性说明 Center 中…...

编程日记 2023/10/7 5:28:34

【Redis】基础数据结构-quicklist

Redis List 在Redis3.2版之前，Redis使用压缩列表和双向链表作为List的底层实现。当元素个数比较少并且元素长度比较小时，Redis使用压缩列表实现，否则Redis使用双向链表实现。 ziplist存在问题不能保存过多的元素，否则查找复杂度…...

编程日记 2023/10/7 5:25:32

QT 实现服务器客户端搭建

1. 服务器头文件 #ifndef SER_H #define SER_H#include <QWidget> #include<QTcpServer> //服务器头文件 #include<QTcpSocket> //客户端头文件 #include<QMessageBox> //消息对话框 #include<QList> //链表头文件QT_BEGIN_NAM…...

编程日记 2023/10/7 5:24:31

Javascript - 轮播图

轮播图也称banner图、广告图、焦点图、滑片。是指在一个模块或者窗口,通过鼠标点击或手指滑动后,可以看到多张图片。这些图片统称为轮播图,这个模块叫做轮播模块。可以通过运用 javascript去实现定时自动转换图片。以下通过一个小Demo演示如何运用Javascript实现。 <!DOCTYP…...

编程日记 2023/10/7 5:23:30

MATLAB中syms函数使用

目录语法说明示例创建符号标量变量创建符号标量变量的向量创建符号标量变量矩阵管理符号标量变量的假设创建和评估符号函数 syms函数的作用是创建符号标量和函数，以及矩阵变量和函数。语法 syms var1 ... varN syms var1 ... varN [n1 ... nM] …...

编程日记 2023/10/7 5:22:29

竞赛选题深度学习 opencv python 实现中国交通标志识别_1

文章目录 0 前言1 yolov5实现中国交通标志检测2.算法原理2.1 算法简介2.2网络架构2.3 关键代码 3 数据集处理3.1 VOC格式介绍3.2 将中国交通标志检测数据集CCTSDB数据转换成VOC数据格式3.3 手动标注数据集 4 模型训练5 实现效果5.1 视频效果 6 最后 0 前言 🔥 优质…...

编程日记 2023/10/7 5:21:28

Qt 关于mouseTracking鼠标追踪和tabletTracking平板追踪的几点官方说明

mouseTracking属性用于保存是否启用鼠标跟踪，缺省情况是不启用的。没启用的情况下，对应部件只接收在鼠标移动同时至少一个鼠标按键按下时的鼠标移动事件。启用鼠标跟踪的情况下，任何鼠标移动事件部件都会接收。部件方法hasMouseTrackin…...

编程日记 2023/10/7 5:20:28

基于springboot的论坛网站

目录前言一、技术栈二、系统功能介绍用户信息管理普通管理员管理交流论坛交流论坛评论三、核心代码 1、登录模块 2、文件上传模块 3、代码封装前言随着信息技术在管理上越来越深入而广泛的应用，管理信息系统的实施在技术上已逐步成熟。本文介绍了…...

编程日记 2023/10/7 5:16:24

分库分表理论总结

一、概述分库分表是在面对高并发、海量数量时常见的数据库层面的解决方案。通过把数据分散到不同的数据库中，使得单一数据库的数据量变小来缓解单一数据库的性能问题，从而达到提升数据库性能的目的。比如：将电商数据库拆分为若干独立的数据…...

编程日记 2023/10/7 5:14:23

RK3568平台开发系列讲解（外设篇）AP3216C 三合一环境传感器驱动

🚀返回专栏总目录文章目录一、AP3216C 简介二、AP3216C驱动程序2.1、设备树修改2.2、驱动程序沉淀、分享、成长，让自己和他人都能有所收获！😄 📢在本篇将介绍AP3216C 三合一环境传感器的驱动。一、AP3216C 简介 AP3216C 是由敦南科技推出的一款传感器，其支持环境光…...

编程日记 2023/10/7 5:13:22

业务系统对接大模型的基础方案：架构设计与关键步骤

业务系统对接大模型：架构设计与关键步骤在当今数字化转型的浪潮中，大语言模型（LLM）已成为企业提升业务效率和创新能力的关键技术之一。将大模型集成到业务系统中，不仅可以优化用户体验，还能为业务决策提供…...

编程新知 2025/10/10 5:22:59

【Python】 -- 趣味代码 - 小恐龙游戏

文章目录文章目录 00 小恐龙游戏程序设计框架代码结构和功能游戏流程总结01 小恐龙游戏程序设计02 百度网盘地址00 小恐龙游戏程序设计框架这段代码是一个基于 Pygame 的简易跑酷游戏的完整实现，玩家控制一个角色（龙）躲避障碍物（仙人掌和乌鸦）。以下是代码的详细介绍：…...

编程新知 2025/10/14 11:01:31

MongoDB学习和应用(高效的非关系型数据库)

一丶 MongoDB简介对于社交类软件的功能，我们需要对它的功能特点进行分析： 数据量会随着用户数增大而增大读多写少价值较低非好友看不到其动态信息地理位置的查询… 针对以上特点进行分析各大存储工具： mysql：关系型数据库&am…...

编程新知 2025/10/12 13:42:12

新能源汽车智慧充电桩管理方案：新能源充电桩散热问题及消防安全监管方案

随着新能源汽车的快速普及，充电桩作为核心配套设施，其安全性与可靠性备受关注。然而，在高温、高负荷运行环境下，充电桩的散热问题与消防安全隐患日益凸显，成为制约行业发展的关键瓶颈。如何通过智慧化管理手段优化散…...

编程新知 2025/10/15 2:34:00

DBAPI如何优雅的获取单条数据

API如何优雅的获取单条数据案例一对于查询类API，查询的是单条数据，比如根据主键ID查询用户信息，sql如下： select id, name, age from user where id #{id}API默认返回的数据格式是多条的，如下： {&qu…...

编程新知 2025/10/6 5:34:30

JAVA后端开发——多租户

数据隔离是多租户系统中的核心概念，确保一个租户（在这个系统中可能是一个公司或一个独立的客户）的数据对其他租户是不可见的。在 RuoYi 框架（您当前项目所使用的基础框架）中，这通常是通过在数据表中增加一个…...

编程新知 2025/8/15 1:44:58

LOOI机器人的技术实现解析：从手势识别到边缘检测

LOOI机器人作为一款创新的AI硬件产品，通过将智能手机转变为具有情感交互能力的桌面机器人，展示了前沿AI技术与传统硬件设计的完美结合。作为AI与玩具领域的专家，我将全面解析LOOI的技术实现架构，特别是其手势识别、物体识别和环境…...

编程新知 2025/6/10 21:22:04

华为OD最新机试真题-数组组成的最小数字-OD统一考试（B卷）

题目描述给定一个整型数组，请从该数组中选择3个元素组成最小数字并输出 (如果数组长度小于3，则选择数组中所有元素来组成最小数字)。输入描述行用半角逗号分割的字符串记录的整型数组，0<数组长度<= 100，0<整数的取值范围<= 10000。输出描述由3个元素组成…...

编程新知 2025/9/21 23:43:15

spring Security对RBAC及其ABAC的支持使用

RBAC (基于角色的访问控制) RBAC (Role-Based Access Control) 是 Spring Security 中最常用的权限模型，它将权限分配给角色，再将角色分配给用户。 RBAC 核心实现 1. 数据库设计 users roles permissions ------- ------…...

编程新知 2025/10/13 19:26:55