当前位置：首页 > news >正文

KNN算法学习实践

news 2026/5/18 0:42:59

1.理论学习

原文链接

ShowMeAI知识社区

2.案例实践

假如一套房子打算出租，但不知道市场价格，可以根据房子的规格（面积、房间数量、厕所数量、容纳人数等），在已有数据集中查找相似（K近邻）规格的房子价格，看别人的相同或相似户型租了多少钱。

我们本次用到的数据集是 rent_price,见附件或第一章链接网盘地址下载。

2.1分类过程

已知的数据集中，每个已出租住房都有房间数量、厕所数量、容纳人数等字段，并有对应出租价格。将预计出租房子数据与数据集中每条记录比较计算欧式距离，取出距离最小的5条记录，将其价格取平均值，可以将其看做预计出租房子的市场平均价格。

先引入需要的包

import pandas as pd
import numpy as np
from scipy.spatial import distance#用于计算欧式距离
from sklearn.preprocessing import StandardScaler#用于对数据进行标准化操作
from sklearn.neighbors import KNeighborsRegressor#KNN算法
from sklearn.metrics import mean_squared_error#用于计算均方根误差

导入数据并提取目标字段，我们看一下dc_listings数据集。

#导入数据并提取目标字段
path = r'rent_price.csv'
file = open(path, encoding = 'gb18030', errors = 'ignore')
dc_listings = pd.read_csv(file)
features = ['accommodates','bedrooms','bathrooms','beds','price','minimum_nights','maximum_nights','number_of_reviews']
dc_listings = dc_listings[features]

2.2进行初步数据清洗

1.数据集中非数值类型的字段需要转换，替换掉美元$符号和千分位符号逗号。

#数据初步清洗
our_acc_value = 3
dc_listings['distance'] = np.abs(dc_listings.accommodates - our_acc_value)
dc_listings = dc_listings.sample(frac=1, random_state=0)
dc_listings = dc_listings.sort_values('distance')
dc_listings['price'] = dc_listings.price.str.replace("\$|,", "").astype(float)
dc_listings = dc_listings.dropna()

2.理想情况下，数据集中每个字段取值范围都相同，但实际上这是几乎不可能的，如果计算时直接用原数据计算，则会造成较大训练误差，所以需要对各列数据进行标准化或归一化操作，尽量减少不必要的训练误差。

#数据标准化
dc_listings[features] = StandardScaler().fit_transform(dc_listings[features])
normalized_listings = dc_listings

3.最好不要将所有数据全部拿来测试，需要分出训练集和测试集具体划分比例按数据集确定。

#取得训练集和测试集
norm_train_df = normalized_listings[:2792]
norm_test_df = normalized_listings[2792:]

2.3计算欧氏距离并预测房屋价格

#scipy包distance模块计算欧式距离
first_listings = normalized_listings.iloc[0][['accommodates', 'bathrooms']]
fifth_listings = normalized_listings.iloc[20][['accommodates', 'bathrooms']]
#用python方法做多变量KNN模型
def predict_price_multivariate(new_listing_value, feature_columns):temp_df = norm_train_df#distance.cdist计算两个集合的距离temp_df['distance'] = distance.cdist(temp_df[feature_columns], [new_listing_value[feature_columns]])temp_df = temp_df.sort_values('distance')#temp_df按distance排序knn_5 = temp_df.price.iloc[:5]predicted_price = knn_5.mean()return predicted_price
cols = ['accommodates', 'bathrooms']
norm_test_df['predicted_price'] = norm_test_df[cols].apply(predict_price_multivariate, feature_columns=cols, axis=1)
norm_test_df['squared_error'] = (norm_test_df['predicted_price'] - norm_test_df['price']) ** 2
mse = norm_test_df['squared_error'].mean()
rmse = mse ** (1/2)
print(rmse)
#利用sklearn完成KNN
col = ['accommodates', 'bedrooms']
knn = KNeighborsRegressor()
#将自变量和因变量放入模型训练，并用测试数据测试
knn.fit(norm_train_df[cols], norm_train_df['price'])
two_features_predictions = knn.predict(norm_test_df[cols])
#计算预测值与实际值的均方根误差
two_features_mse = mean_squared_error(norm_test_df['price'], two_features_predictions)
two_features_rmse = two_features_mse ** (1/2)
print(two_features_rmse)

输出为：

1.4667825805653032
1.5356457412450537

2.3全部代码

import mathimport pandas as pd
import numpy as np
from scipy.spatial import distance # 用于计算欧氏距离
from sklearn.preprocessing import StandardScaler # 用于对数据进行标准化操作
from sklearn.neighbors import KNeighborsRegressor # KNN算法
from sklearn.metrics import mean_squared_error # 用于计算均方根误差#导入数据并提取目标字段
path = r'E:\DeepLearn\KNN\rent_price.csv'
file = open(path, encoding='gb18030', errors='ignore')
dc_listings = pd.read_csv(file)
features = ['accommodates','bedrooms','bathrooms','beds','price','minimum_nights','maximum_nights','number_of_reviews']
dc_listings = dc_listings[features]#数据初步清洗
# 数据集中非数值类型的字段需要转换，替换掉美元$符号和千分位逗号。
our_acc_value = 3
dc_listings['distance'] = np.abs(dc_listings.accommodates - our_acc_value)
dc_listings = dc_listings.sample(frac = 1, random_state = 0)
dc_listings = dc_listings.sort_values('distance')
dc_listings['price'] = dc_listings.price.str.replace('\$|,','').astype(float)
dc_listings = dc_listings.dropna()# 数据标准化
dc_listings[features] = StandardScaler().fit_transform(dc_listings[features])
normalized_listings = dc_listings# 取得训练集和测试集
norm_train_df = normalized_listings[: 2792]
norm_test_df = normalized_listings[2792:]# 计算欧氏距离并预测房屋价格# scipy包distance模块计算欧氏距离
first_listings = normalized_listings.iloc[0][['accommodates', 'bathrooms']]
fifth_listings = normalized_listings.iloc[20][['accommodates', 'bathrooms']]# 用python方法做多变量KNN模型
def predict_price_multivariate(new_listings_value, feature_columns):temp_df = norm_train_df# distance.cdist计算两个集合的距离temp_df['distance'] = distance.cdist(temp_df[feature_columns], [new_listings_value[feature_columns]])# temp_df 按distance排序temp_df = temp_df.sort_values('distance')knn_5 = temp_df.price.iloc[:5]predicted_price = knn_5.mean()return predicted_pricecols = ['accommodates', 'bathrooms']
norm_test_df['predicted_price'] = norm_test_df[cols].apply(predict_price_multivariate, feature_columns = cols, axis = 1)
norm_test_df['squared_error'] = (norm_test_df['predicted_price'] - norm_test_df['price']) ** 2
mse = norm_test_df['squared_error'].mean()
rmse = mse ** 0.5
print(rmse)# 利用sklearn完成KNN
col = ['accommodates', 'bedrooms']
knn = KNeighborsRegressor()
# 将自变量和因变量放入模型训练，并用测试数据测试
knn.fit(norm_train_df[cols],norm_train_df["price"])
two_features_predictions = knn.predict(norm_test_df[cols])# 计算预测值与实际值的均方根误差
two_features_mse = mean_squared_error(norm_test_df['price'], two_features_predictions)
two_features_rmse = math.sqrt(two_features_mse)
print(two_features_rmse)

KNN算法学习实践

1.理论学习原文链接 ShowMeAI知识社区 2.案例实践假如一套房子打算出租，但不知道市场价格，可以根据房子的规格（面积、房间数量、厕所数量、容纳人数等），在已有数据集中查找相似（K近邻）规格…...

编程日记 2025/1/28 13:58:47

数据可视化的图表

1.折线图反映了一段时间内事物连续的动态变化规律,适用于描述一个变量随另一个变量变化的趋势,通常用于绘制连续数据,适合数据点较多的情况。 2.散点图是以直角坐标系中各点的密集程度和变化趋势来表示两种现象间的相关关系，常用于显示和比较数值。当要在不考虑时间…...

编程日记 2025/1/28 13:57:45

动手学深度学习-卷积神经网络-3填充和步幅

目录填充步幅小结在上一节的例子（下图） 中，输入的高度和宽度都为3，卷积核的高度和宽度都为2，生成的输出表征的维数为22。正如我们在上一节中所概括的那样，假设输入形状为nhnw，卷积核形…...

编程日记 2025/1/28 13:55:39

【JS|第28期】new Event()：前端事件处理的利器

日期：2025年1月24日作者：Commas 签名：(ง •_•)ง 积跬步以致千里,积小流以成江海…… 注释：如果您觉得有所帮助，帮忙点个赞，也可以关注我，我们一起成长；如果有不对的地方&#xf…...

编程日记 2025/1/28 13:48:30

Spring Boot 中的事件发布与监听：深入理解 ApplicationEventPublisher（附Demo）

目录前言1. 基本知识2. Demo3. 实战代码前言 🤟 找工作，来万码优才：👉 #小程序://万码优才/r6rqmzDaXpYkJZF 基本的Java知识推荐阅读： java框架零基础从入门到精通的学习路线附开源项目面经等（超全&am…...

编程日记 2025/1/28 13:45:26

【Spring】Spring启示录

目录前言一、示例程序二、OCP开闭原则三、依赖倒置原则DIP 四、控制反转IOC 总结前言在软件开发的世界里，随着项目的增长和需求的变化，如何保持代码的灵活性、可维护性和扩展性成为了每个开发者必须面对的问题。传统的面向过程或基于类的设计…...

编程日记 2025/1/28 13:43:23

ospf动态路由配置，cost路径调整，ospf认证实验

一、实验拓扑如图： 接口ip配置网络 ：10.17.12.* 10.17.13.* ，10.17.23.* 回环接口配置分别为 10.0.1.1 ，10.0.1.2，10.0.1.3对应三台路由器 ar1配置接口ip interface GigabitEthernet0/0/0 ip address 10.17.12.1…...

编程日记 2025/1/28 13:40:20

在Rust应用中访问.ini格式的配置文件

在Rust应用中访问.ini格式的配置文件，你可以使用第三方库，比如 ini 或 config. 下面是一个使用 ini 库的示例，该库允许你读取和解析.ini文件。使用 ini 库添加依赖首先，你需要在你的 Cargo.toml 文件中添加 ini 库的依赖&am…...

编程日记 2025/1/28 13:39:07

批量处理多个模型的预测任务

#!/bin/bash# 检查是否传入必要的参数，若未传入参数则打印用法并退出 if [ "$#" -lt 1 ]; thenecho "用法: $0 <file_path>"echo "示例: $0 /home/aistudio/work/PaddleSeg/city/cityscapes_urls_extracted.txt"exit 1 fi# 读取…...

编程日记 2025/1/28 13:36:01

Java 编程初体验

Java学习资料 Java学习资料 Java学习资料一、引言在当今数字化的时代，编程已然成为一项极具价值的技能。而 Java 作为一门广泛应用于企业级开发、移动应用、大数据等众多领域的编程语言，吸引着无数初学者投身其中。当我们初次踏入 Java 编程的世界&…...

编程日记 2025/1/28 13:31:52

element-plus 的table section如何实现单选

如果是单选那么全新的按钮应该隐藏或者不可编辑的状态。但是我没找到改变成不可编辑的方法，只能采取隐藏 <template><div><el-table ref"proTab…...

编程日记 2025/1/28 13:28:44

【JavaEE进阶】图书管理系统 - 壹

目录 🌲序言 🌴前端代码的引入 🎋约定前后端交互接口 🚩接口定义 🍃后端服务器代码实现 🚩登录接口 🚩图书列表接口 🎄前端代码实现 🚩登录页面 🚩…...

编程日记 2025/1/28 13:27:42

文章目录 A-时间表B-数独数组D-隐匿社交网络E-1or0 A-时间表签到题 #include <bits/stdc.h> using namespace std;int main() {int a[6] {20250121,20250123,20250126,20250206,20250208,20250211};int n; cin >> n;cout << a[n - 1];return 0; }B-数独数…...

编程日记 2025/1/28 13:25:38

Mybatis配置文件详解

MyBatis通过XML或注解的方式将Java对象与数据库中的记录进行映射，极大地简化了数据访问层的开发。而在MyBatis的核心组成部分中，配置文件扮演着举足轻重的角色。它不仅定义了MyBatis的运行环境，还配置了数据源、事务管理、映射器等关键元素&a…...

编程日记 2025/1/28 13:22:23

《深度揭秘：TPU张量计算架构如何重塑深度学习运算》

在深度学习领域，计算性能始终是推动技术发展的关键因素。从传统CPU到GPU，再到如今大放异彩的TPU（张量处理单元），每一次硬件架构的革新都为深度学习带来了质的飞跃。今天，就让我们深入探讨TPU的张量计算架构…...

编程日记 2025/1/28 13:21:05

Java基础知识总结（二十二）--List接口

List本身是Collection接口的子接口，具备了Collection的所有方法。现在学习List体系特有的共性方法，查阅方法发现List的特有方法都有索引，这是该集合最大的特点。 List：有序(元素存入集合的顺序和取出的顺序一致)，元素都…...

编程日记 2025/1/28 13:17:56

[STM32 - 野火] - - - 固件库学习笔记 - - -十二.基本定时器

一、定时器简介 STM32 中的定时器（TIM，Timer）是其最重要的外设之一，广泛用于时间管理、事件计数和控制等应用。 1.1 基本功能定时功能：TIM定时器可以对输入的时钟进行计数，并在计数值达到设定值时触发中…...

编程日记 2025/1/28 13:16:55

算法随笔_27:最大宽度坡

上一篇:算法随笔_26: 按奇偶排序数组-CSDN博客题目描述如下: 给定一个整数数组 nums，坡是元组 (i, j)，其中 i < j 且 nums[i] < nums[j]。这样的坡的宽度为 j - i。找出 nums 中的坡的最大宽度，如果不存在，返回 0 。 …...

编程日记 2025/1/28 13:14:52

无公网IP 外网访问本地部署 llamafile 大语言模型

llamafile 是一种AI大模型部署（或者说运行）的方案，它的特点就是可以将模型和运行环境打包成一个独立的可执行文件，这样就简化了部署流程。用户只需要下载并执行该文件，无需安装运行环境或依赖库，这大大提高…...

编程日记 2025/1/28 13:13:50

使用PC版本剪映制作照片MV

目录制作MV模板时长调整拖动边缘缩短法分割删除法变速法整体调整法制作MV 导入音乐导入歌词点击歌词和片头可以修改字体： 还可以给字幕添加动画效果： 导入照片，自动创建照片轨： 修改片头字幕：增加两条字幕轨&…...

编程日记 2025/1/28 13:10:42

RAG 系列（十七）：Agentic RAG——让 Agent 主导检索过程

Pipeline RAG 的沉默失败前面十几篇一直在优化一件事：怎么让检索结果更好。更好的分块、更精准的排序、更聪明的问法、CRAG 纠偏、Graph RAG 关系遍历…… 但有一件事始终没变：无论检索结果好不好，都会被传给 LLM 生成答案。 Pipeline RAG 的流程是线性的、固定的：问…...

编程新知 2026/5/17 10:16:11

手把手教你用三菱FX3U PLC的RS指令和RS2指令与电脑串口调试助手‘对话’

三菱FX3U PLC串口通信实战：从零搭建RS485数据收发系统第一次接触工业控制系统的串口通信时，我被那些密密麻麻的接线和晦涩的协议参数弄得晕头转向。直到在自动化生产线上亲眼看到PLC通过两根电线与十几台设备稳定通信，才意识到串口技术的精妙…...

编程新知 2026/5/17 9:33:39

Python与ChatGPT构建智能办公自动化：从任务分解到智能体系统

1. 项目概述：用Python与ChatGPT联手，让办公自动化“开口说话”如果你每天还在重复着打开Excel、复制粘贴数据、手动写邮件、整理报告这些枯燥的活儿，那这个项目可能就是你的“数字员工”入职通知书。Sven-Bo/automate-office-tasks-using-cha…...

编程新知 2026/5/17 7:55:58

Supabase AI Agent技能库：安全集成数据库操作与边缘函数调用

1. 项目概述：当Supabase遇上AI Agent，一个技能库的诞生最近在捣鼓AI Agent应用开发，发现一个挺有意思的现象：大家都能用LangChain、LlamaIndex这些框架快速搭出个Agent的架子，但真想让这个Agent去干点具体、有用的活儿…...

编程新知 2026/5/17 7:45:02

LVGL在无显存TFT屏上的驱动适配：双缓冲与DMA优化实践

1. 项目概述：当TFT屏幕遇上LVGL最近在做一个嵌入式GUI项目，核心任务是把LVGL这个轻量级图形库，适配到一块分辨率不算高但接口比较“个性”的TFT屏幕上。这活儿听起来像是把标准插头插到非标插座上，得自己动手改改线序。LVGL这几年…...

编程新知 2026/5/17 7:36:06

轻量级HTTP代理monica-proxy：精准流量转发与多场景部署指南

1. 项目概述与核心价值最近在折腾一些需要跨网络环境访问特定服务的项目，发现一个挺有意思的工具叫ycvk/monica-proxy。这本质上是一个基于 Go 语言开发的轻量级 HTTP/HTTPS 代理服务器，但它和我们常见的那些“全能型”代理不太一样。它的设计初衷非常聚…...

编程新知 2026/5/17 6:59:21

ElevenLabs葡语语音私密训练技巧（仅限白名单客户使用的SSML扩展语法+方言权重微调指令集）

更多请点击： https://intelliparadigm.com 第一章：ElevenLabs葡语语音私密训练的核心价值与白名单准入机制 ElevenLabs 的葡语语音私密训练（Private Voice Fine-tuning for Portuguese）专为高合规性场景设计，面向金融…...

编程新知 2026/5/17 5:39:43

Arduino与手机蓝牙通信：nRF8001 BLE模块硬件连接与软件配置全解析

1. 项目概述与核心价值如果你手头有一个Arduino项目，想让它和你的手机“说说话”，比如把传感器数据无线传到手机App上显示，或者用手机App远程控制几个LED灯，那么nRF8001这个蓝牙低功耗（BLE）模块绝对是你绕不…...

编程新知 2026/5/17 5:25:26

认识Python数据包套接字

如你所知，数据包格式套接字（Datagram Sockets）也叫“无连接的套接字”，在代码中使用 SOCK_DGRAM 表示。可以将 SOCK_DGRAM 比喻成高速移动的摩托车快递，它有以下特征：强调快速传输而非传输顺序；…...

编程新知 2026/5/17 5:23:25

开源容器镜像仓库cc-hub：从协议兼容到生产部署的完整实践指南

1. 项目概述：一个面向容器化应用的开源镜像仓库最近在整理团队内部的容器镜像管理方案时，我重新审视了开源镜像仓库这个领域。虽然市面上有 Harbor、Docker Registry 等成熟方案，但总有一些场景，比如轻量级内网部署、特定架构&…...

编程新知 2026/5/17 4:29:30

KNN算法学习实践

1.理论学习

2.案例实践

2.1分类过程

2.2进行初步数据清洗

2.3计算欧氏距离并预测房屋价格

2.3全部代码

相关文章：

KNN算法学习实践

数据可视化的图表

动手学深度学习-卷积神经网络-3填充和步幅

【JS|第28期】new Event()：前端事件处理的利器

Spring Boot 中的事件发布与监听：深入理解 ApplicationEventPublisher（附Demo）

【Spring】Spring启示录

ospf动态路由配置，cost路径调整，ospf认证实验

在Rust应用中访问.ini格式的配置文件

批量处理多个模型的预测任务

Java 编程初体验

element-plus 的table section如何实现单选

【JavaEE进阶】图书管理系统 - 壹

牛客周赛 Round 77 题解

Mybatis配置文件详解

《深度揭秘：TPU张量计算架构如何重塑深度学习运算》

Java基础知识总结（二十二）--List接口

[STM32 - 野火] - - - 固件库学习笔记 - - -十二.基本定时器

算法随笔_27:最大宽度坡

无公网IP 外网访问本地部署 llamafile 大语言模型

使用PC版本剪映制作照片MV

RAG 系列（十七）：Agentic RAG——让 Agent 主导检索过程

手把手教你用三菱FX3U PLC的RS指令和RS2指令与电脑串口调试助手‘对话’

Python与ChatGPT构建智能办公自动化：从任务分解到智能体系统

Supabase AI Agent技能库：安全集成数据库操作与边缘函数调用

LVGL在无显存TFT屏上的驱动适配：双缓冲与DMA优化实践

轻量级HTTP代理monica-proxy：精准流量转发与多场景部署指南

ElevenLabs葡语语音私密训练技巧（仅限白名单客户使用的SSML扩展语法+方言权重微调指令集）

Arduino与手机蓝牙通信：nRF8001 BLE模块硬件连接与软件配置全解析

认识Python数据包套接字

开源容器镜像仓库cc-hub：从协议兼容到生产部署的完整实践指南