当前位置：首页 > news >正文

如何快速从csv文件搭建一个简单的神经网络模型（回归）

news 2025/12/26 4:47:24

快速搭建一个简单的神经网络预测模型
采用的数据是kaggle的房价预测数据
涉及的数据文件，提取码为：zxcv

#导入相关包
import pandas as pd
import numpy as np
import torch
import torch.nn as nn

首先读取数据

train=pd.read_csv("path",encoding="gbk")
test=pd.read_csv("path",encoding="gbk")

数据预处理
数据预处理包括：对数据进行标准化处理，将非数字类型数据转化为数字类型数据

#查看训练集和测试集的数据大小
train.shape
#(1460, 81)
test.shape
#(1460, 81)
#将需要训练和测试的特征合成为一个DataFrame，保证对于训练数据和测试数据的处理是一致的。
all_feature=pd.concat([train.iloc[:,1:80],test.iloc[]])
#找出数字类型的数据，进行标准化处理
num_da=[i for i in all_feature.columns if all_feature[i].dtypes!='object']
all_feature[num_da]=all_feature[num_da].apply(lambda x: (x-x.mean())/x.std())
#将非数字类型数据转化为数字类型的数据
all_feature=pd.get_dummies(all_feature,dummy_na=True)
#对缺失值用所在列的均值进行填充
all_feature = all_feature.fillna(all_feature.mean())
#将训练数据的y取log值
train_y=train['SalePrice'].apply(lambda x:np.log(x))

将数据划分为训练数据集，和测试数据集：做好数据的预处理转化工作之后

X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42)
X_train = torch.tensor(X_train.values, dtype=torch.float32)
y_train = torch.tensor(y_train.values, dtype=torch.long)
X_test = torch.tensor(X_test.values, dtype=torch.float32)
y_test = torch.tensor(y_test.values, dtype=torch.long)```数据转换```python
#我们需要将dataframe数据转化为神经网络能处理的tensor数据
input_x=torch.tensor(all_feature.iloc[:train.shape[0],:].values.astype(np.float32))
input_y=torch.tensor(train_y.values.astype(np.float32))
test_x=torch.tensor(all_feature.iloc[train.shape[0]:,:].values.astype(np.float32))
#查看各类数据的维度是否符合要求
input_x
input_y
test_x

模型搭建

input_size = input_x.shape[1] #样本个数
hidden1_size = 128 # 隐含层神经元个数
hidden2_size=256
output_size = 1
batch_size = 16
my_nn = torch.nn.Sequential(torch.nn.Linear(input_size, hidden1_size), #全连接层torch.nn.ReLU(),  #激活函数torch.nn.Linear(hidden1_size, hidden2_size), #全连接层torch.nn.ReLU(), #激活函数torch.nn.Linear(hidden2_size, output_size),
)
# MSE损失函数
cost = torch.nn.MSELoss(reduction='mean')
# Adam优化器
optimizer = torch.optim.Adam(my_nn.parameters(), lr=0.001)

模型训练

losses = []
for i in range(500):batch_loss = []# MINI-Batch方法来进行训练for start in range(0, len(input_x), batch_size):end = start + batch_size if start + batch_size < len(input_x) else len(input_x)xx = torch.tensor(input_x[start:end],dtype=torch.float,requires_grad=True)yy = torch.tensor(input_y[start:end],dtype=torch.float,requires_grad=True)prediction = my_nn(xx)# 前向传播loss = cost(prediction, yy) # 计算损失optimizer.zero_grad() # 梯度清零loss.backward(retain_graph=True) #反向传播optimizer.step() # 更新参数batch_loss.append(loss.data.numpy()) #记录损失，便于打印# 打印损失if i % 100 == 0:losses.append(np.mean(batch_loss))print(i, np.mean(batch_loss))

模型保存

torch.save(my_nn,'model.pth')
print("Saved PyTorch Model to model.pth")

模型预测

#加载模型
model =torch.load("model.pth")
#不改变模型参数的基础上进行预测
pred=model(torch.tensor(test_x)).detach()
#对预测后的结果进行还原（之前取了对数）
pred=np.exp(pred)

保存结果

#对测试的结果进行保存
test['SalePrice']=pred.reshape(1,-1)[0]
sub=pd.concat([test["Id"],test["SalePrice"]],axis=1)
sub=sub.set_index("Id")
sub.to_csv("sub.csv")

如何快速从csv文件搭建一个简单的神经网络模型（回归）

快速搭建一个简单的神经网络预测模型采用的数据是kaggle的房价预测数据涉及的数据文件，提取码为：zxcv #导入相关包 import pandas as pd import numpy as np import torch import torch.nn as nn首先读取数据 trainpd.read_csv("path",enc…...

编程日记 2023/7/27 13:41:38

Pytorch深度学习-----DataLoader的用法

系列文章目录 PyTorch深度学习——Anaconda和PyTorch安装 Pytorch深度学习-----数据模块Dataset类 Pytorch深度学习------TensorBoard的使用 Pytorch深度学习------Torchvision中Transforms的使用（ToTensor，Normalize，Resize ，Co…...

编程日记 2023/7/27 13:40:37

macOS Ventura 13.5 (22G74) Boot ISO 原版可引导镜像下载

macOS Ventura 13.5 (22G74) Boot ISO 原版可引导镜像下载本站下载的 macOS 软件包，既可以拖拽到 Applications（应用程序）下直接安装，也可以制作启动 U 盘安装，或者在虚拟机中启动安装。另外也支持在 Windows 和 Lin…...

编程日记 2023/7/27 13:39:36

【机器学习】奇异值分解（SVD）和主成分分析（PCA）

一、说明在机器学习 （ML） 中，一些最重要的线性代数概念是奇异值分解 （SVD） 和主成分分析 （PCA）。收集到所有原始数据后，我们如何发现结构？例如，通过过去 6 天…...

编程日记 2023/7/27 13:38:33

如何用logging记录python实验结果？

做python实验有时候需要打印很多信息在控制台(console），但是控制台的信息不方便回顾和保存，故而可以采用logging将信息存储起来。先新建一个文件message.log代码如下： import logging logging.basicConfig(filename"messa…...

编程日记 2023/7/27 13:37:32

C语言假期作业 DAY 03

目录题目一、选择题 1、已知函数的原型是： int fun(char b[10], int *a); ，设定义： char c[10];int d; ，正确的调用语句是（ ） 2、请问下列表达式哪些会被编译器禁止【多选】（ ） 3、…...

编程日记 2023/7/27 13:36:31

使用serverless实现从oss下载文件并压缩

公司之前开发一个网盘系统, 可以上传文件, 打包压缩下载文件, 但是在处理大文件的时候, 服务器遇到了性能问题, 主要是这个项目是单机部署.......(离谱), 然后带宽只有100M, 现在用户比之前多很多, 然后所有人的压缩下载请求都给到这一台服务器了, 比如多个人下载的时候带宽问…...

编程日记 2023/7/27 13:35:29

从上到下打印二叉树

题目描述从上到下打印出二叉树的每个节点，同一层的节点按照从左到右的顺序打印。例如: 给定二叉树: [3,9,20,null,null,15,7], 返回： [3,9,20,15,7] 算法思想建立一个vector数组ret用来当做返回的结果数组，建立一个队列用来接收二叉树…...

编程日记 2023/7/27 13:34:29

【推荐】排序模型的调优

【推荐】排序模型的调优排序模型的选择排序模型常见的训练方式样本类别不均衡处理尝试欠拟合过拟合其他问题排序模型的选择 LR，GBDT，LRGBDT，FM/FFM， 深度模型（wide & deep，DeepFM&#x…...

编程日记 2023/7/27 13:33:26

负载均衡安装配置详解

负载均衡（Load Balancing）是一种将网络流量分布到多个服务器上的技术，以提高系统的性能、可靠性和可扩展性。在负载均衡中，有一个负载均衡器（Load Balancer），它充当了传入请求的前置接收器。当…...

编程日记 2023/7/27 13:32:25

Java-逻辑控制

目录一、顺序结构二、分支结构 1.if语句 2.swich语句三、循环结构 1.while循环 2.break 3.continue 4.for循环 5.do while循环四、输入输出 1.输出到控制台 2.从键盘输入一、顺序结构按照代码的书写结构一行一行执行。 System.out.println("aaa"); …...

编程日记 2023/7/27 13:31:24

UE 透明渲染次序

附加顺序用最外面的球, 依次附加里面的球最后附加的物体优先级最高附加顺序用最里面的球, 依次附加外面的球这样渲染顺序就对了...

编程日记 2023/7/27 13:30:23

【C++】多态原理剖析，Visual Studio开发人员工具使用查看类结构cl /d1 reportSingleClassLayout

author：&Carlton tag：C topic：【C】多态原理剖析，Visual Studio开发人员工具使用查看类结构cl /d1 reportSingleClassLayout website:黑马程序员C tool：Visual Studio 2019 date：2023年7月24日目…...

编程日记 2023/7/27 13:29:22

vue实现flv格式视频播放

公司项目需要实现摄像头实时视频播放，flv格式的视频。先百度使用flv.js插件实现，但是两个摄像头一个能放一个不能放，没有找到原因。（开始两个都能放，后端更改地址后不有一个不能放）但是在另一个系统上是可以…...

编程日记 2023/7/27 13:27:20

iptables安全技术和防火墙

防火墙：隔离功能位置：部署在网络边缘或主机边缘，在工作中，防火墙的主要作用是决定哪些数据可以被外网访问以及哪些数据可以进入内网访问，主要在网络层工作其他类型的安全技术：1、入侵检测系统 2、入侵…...

编程日记 2023/7/27 13:26:19

微信小程序开发5

一、自定义组件-插槽 1.1、什么是插槽在自定义组件的wxml结构中，可以提供一个<slot>节点(插槽)，用于承载组件使用者提供的wxml结构 1.2、单个插槽在小程序中，默认每个自定义组件中允许使用一个<slot>进行占位，这种…...

编程日记 2023/7/27 13:25:17

【算法题】2681. 英雄的力量

题目： 给你一个下标从 0 开始的整数数组 nums ，它表示英雄的能力值。如果我们选出一部分英雄，这组英雄的力量定义为： i0 ，i1 ，… ik 表示这组英雄在数组中的下标。那么这组英雄的力量为 max(nums[i0],n…...

编程日记 2023/7/27 13:24:14

fastutil简单测试下性能

前言简单测试一下fastutil的实现和Java类库实现的速率。使用jmh进行测试。简单解释一下，每轮测试预热2次，每次1s；实测2次，每次1秒。进行5轮测试。数组大小3种。 package fastutil;import it.unimi.dsi.fastutil.ints.IntArr…...

编程日记 2023/7/27 13:23:13

【FAQ】关于无法判断和区分用户与地图交互手势类型的解决办法

一． 问题描述当用户通过缩放手势、平移手势、倾斜手势和旋转手势与地图交互，控制地图移动改变其可见区域时，华为地图SDK没有提供直接获取用户手势类型的API。二． 解决方案华为地图SDK的地图相机有提供CameraPosition类&…...

编程日记 2023/7/27 13:22:12

腾讯云裸金属服务器CPU型号处理器主频说明

腾讯云裸金属服务器CPU型号是什么？标准型BMSA2裸金属服务器CPU采用AMD EPYC ROME处理器，BMS5实例CPU采用Intel Xeon Cooper Lake处理器，腾讯云服务器网分享落进书房武器CPU型号、处理器主频说明： 裸金属服务器CPU处理器说明腾讯…...

编程日记 2023/7/27 13:21:11

#include <iostream> #include <vector> #include <cmath> #include <Eigen/Dense> // 需安装Eigen库用于矩阵运算 // 定义点结构 struct Point { double x, y; Point(double x_, double y_) : x(x_), y(y_) {} }; // 最小二乘法求圆心和半径 …...

编程新知 2025/12/24 13:52:56