对泰坦尼克号沉没事件幸存者数据分析和预测
一、分析目的
探究决定泰坦尼克号沉没事件中什么因素决定着船上人的生死,并对实例进行判别和预测。
二、数据介绍
Titanic.csv数据中包含了891个样本,记录了泰坦尼克号遇难时的891个乘客的基本信息,其中包括以下信息:
PassengerId: 乘客编号
Survived: 生还情况,生还为1,死亡为0
Pclass: 舱位,分为1,2,3等,1为最高的,3为最低等
Name: 姓名
Sex: 性别
Age: 年龄
SibSp: 同船的兄弟姐妹或配偶
Parch: 同船的父母或子女
Ticket: 船票信息
Fare: 乘客票价
Cabin: 客舱编号
Embarked: 登船地点,C,S,Q分别代表三个不同的地点
数据集:
链接: https://pan.baidu.com/s/1YpT8Pjg35fe_0lrpl7wClw 提取码: 9uq2http://通过网盘分享的文件:泰坦尼克号 链接: https://pan.baidu.com/s/1YpT8Pjg35fe_0lrpl7wClw 提取码: 9uq2
三、实现与结果解读
1.数据处理
先导入数据,对其进行缺失值情况的查看:
d1<-read.csv('D:/R Course/data/Titanic.csv')d1str(d1)install.packages(c('VIM','mice'))library('VIM')library('mice')map<-matrixplot(d1)map
运行结果:
颜色代表变量值大小,浅色值小,深色值大,而红色代表缺失值,由此发现年龄缺失值较多,在进行数据分析前需要先进行数据缺失值处理,这里我们直接将缺失数据的行剔除,得到新的数据集进行接下来的分析。
d2<-na.omit(d1) #数据处理d2
接下来采用两种方法实现对上述处理过的数据集的分析和预测。
2. 多元逻辑回归分析
先对数据进行全变量逻辑回归分析:
多元逻辑回归logit.glm<-glm(factor(Survived)~factor(Pclass)+factor(Sex)+Age,family=binomial,data=d2)summary(logit.glm)
可以看出,船舱等级(Pclass)、性别(Sex)、年龄(Age)、同船的兄弟姐妹或配偶(SibSp)四个因素对生还情况的影响较为显著。选取这四个特征进行分析绘图,观察生还情况和这四个因素的具体关系。
(1)舱位等级因素:
#船舱等级——存活图Pclass_S<-table(d2$Survived,d2$Pclass)Pclass_SPclass_S_prop<-prop.table(Pclass_S,2)Pclass_S_propggplot(data=d2,aes(x=Pclass,fill=factor(Survived)))+geom_bar(stat = 'count',position = 'dodge')+scale_x_continuous(breaks=(1:3))+labs(x='Pclass')
运行结果:
在三个不同等级的船舱中,3等船舱的人数最多,并且可以明显看出随着船舱等级升高,乘客的生还率上升,推断船舱等级越高,救生措施可能完善,且乘客地位高,分配到的救生资源多,乘客生还的可能性越大。
(2)性别因素:
#性别——存活图Sex_S <- table(d2$Survived, d2$Sex)Sex_SSex_S_prop <- prop.table(Sex_S, 2)Sex_S_propggplot(data = d2, aes(x = Sex, fill = factor(Survived)))+geom_bar(stat='count', position='dodge')
运行结果:
进入现代社会后,女士优先已经不再是男士们表现绅士的行为,而是已经成为了一种类似于道德标准的社会行为准则,在百年前的泰坦尼克号上是否也一样呢?从以上数据可看出,女性生还率要大于男性,推断可能是男士们把更多的生存机会给了女性,也可能是与救援时女性优先的原则有关,且查阅资料可知,女性在寒冷环境中体温下降较慢,当时多数人从船上跳入海中逃生,在海水低温条件下,女性在保存体温生存下去等待救援方面有天然优势,以上生还结果与此也应有关联。
(3)年龄因素:
#年龄——存活图Agedata <- as.numeric(unlist(d2$Age))Age_S <- table(d2$Survived, cut(Agedata, breaks = c(0, 15, 30, 45, 60, 75, 90),labels = c('kids', 'teenagers', 'prime', 'middle', 'agedness', 'senium' )))Age_SAge_S_prop <- prop.table(Age_S, 2)Age_S_propggplot(data = data.frame(d2$Survived, Agedata), aes(x = cut(Agedata, breaks = c(0, 15, 30, 45, 60, 75, 90)),fill = factor(d2.Survived)))+geom_bar(stat='count', position='dodge') +labs(x = 'Age') + scale_x_discrete(labels = c('kids', 'teenagers', 'prime', 'middle', 'agedness', 'senium'))
运行结果:
可见儿童生还率较高,与救援时妇幼优先原则应该有关,且在危难关头,父母为了保全孩子,可能会让出紧缺的救援名额,因此儿童生还率较其他年龄段高出不少。
(4)同船的兄弟姐妹或配偶数因素
#家庭人数——存活图Fsize<-data$SibSp +data$Parch#家庭人数=兄弟姐妹或配偶+父母儿女ggplot(data, aes(x = Fsize, fill = factor(Survived))) +geom_bar(stat='count', position='dodge')+ #stat='count'表示统计出现次数,position='dodge'表示柱状图分开摆放scale_x_continuous(breaks=c(1:11)) +#坐标轴刻度labs(x = '家庭人数',y='数量')
运行结果:
可见大致情况为配偶数量越少,生还率越高,但不绝对影响,推测遇难时同行人数多并不会增大生还的可能。
3. 判别分析:
(1)Fisher判别法
#Fisher判别法library(MASS)ld=lda(Survived~Sex+Pclass+SibSp+Parch);ldlp=predict(ld)Survived1=lp$classtab1=table(Survived,Survived1);tab1sum(diag(prop.table(tab1)))
对于Fisher判别法的结果图,乘客遇难的先验概率为0.616,生还的先验概率为0.384,这证明在此次事故中遇难人数是生还人数的两倍;观察判别矩阵可以看出,遇难的有472人被判对,生还的有233人被判对,判对率为0.787,概率较高。
(2)距离判别法
#距离判别法qd=qda(Survived~Sex+Pclass+SibSp+Parch);ldqp=predict(qd)Survived2=qp$classtab2=table(Survived,Survived2);tab2sum(diag(prop.table(tab2)))
对于距离判别法的结果图,乘客遇难的先验概率为0.616,生还的先验概率为0.384,观察判别矩阵可以看出,遇难的有473人被判对,生还的有231人被判对,判对率为0.79,概率较高。
因为距离判别法的判对率略大于Fisher判别法,因此对新样本预测时采用距离判别法。
(3)对新样本进行预测
#预测predict(qd,data.frame(Pclass=1,sex='female',Sibsp=0,Parch=0))
输入新样本对其是否可以生还进行判断,通过结果可以看出生还的概率为0.996,因此判别结果为“生还”。
相关文章:

对泰坦尼克号沉没事件幸存者数据分析和预测
一、分析目的 探究决定泰坦尼克号沉没事件中什么因素决定着船上人的生死,并对实例进行判别和预测。 二、数据介绍 Titanic.csv数据中包含了891个样本,记录了泰坦尼克号遇难时的891个乘客的基本信息,其中包括以下信息: Passenger…...
算法之排序算法
排序算法 ♥常见排序算法知识体系详解♥ | Java 全栈知识体系 算法 - 排序 | CS-Notes 面试笔记 十大经典排序算法总结 | JavaGuide...
DMA发送全部历史记录数据到串口
背景 博主参与的项目中,有个读取全部历史记录的功能,如果下位机在主程序中将全部历史记录单纯地通过串口传输会比较占用cpu资源,影响主程序中别的功能。最后商量得出以下实现方案: 定义两个发送缓冲区DMATxbuf1和DMATxbuf2&…...

蓝桥杯好题推荐-----高精度减法
🌈个人主页:羽晨同学 💫个人格言:“成为自己未来的主人~” 题目链接 记录详情 - 洛谷 | 计算机科学教育新生态https://www.luogu.com.cn/record/205122671 思路讲解 这个题目的解题思路,其实是和高精度加法是非常像的。怎么说…...

SpringMVC (3)
目录 1. 传递对象 2. 后端参数重命名(后端参数映射) 3. 传递数组 4. 传递集合 5. 传递JSON数据 5.1 JSON概念 5.2 JSON语法 5.3 JSON字符串和Java对象互转 5.4 JSON优点 5.5 传递JSON对象 6. 获取URL中参数PathVariable 7. 上传文件RequestP…...

vscode使用豆包MARSCode----集成doubao1.5 DeepSeekR1 DeepseekV3模型的ai编程插件
引入扩展 打开VSCode扩展窗口,在搜索窗口搜索MarsCode,找到MarsCode 插件单击「install」,完成安装,登录即可使用MarsCode 编程助手。 主要功能 主要快捷键 / explain 解释项目代码,AI 返回的内容有结构分类&#…...
Ubuntu 下 nginx-1.24.0 源码分析 - ngx_buf_t
ngx_buf_t 定义在 src/core/ngx_buf.h typedef struct ngx_buf_s ngx_buf_t;struct ngx_buf_s {u_char *pos;u_char *last;off_t file_pos;off_t file_last;u_char *start; /* start of buffer */u_char …...

分布式开源协调服务之zookeeper
Zookeeper简介 Zookeeper是什么? Zookeeper官网中对Zookeeper的定义还是比较明确的: ZooKeeper is a centralized service for maintaining configuration information, naming, providing distributed synchronization, and providing group services…...
ubuntu系统安装playhouse三方库
ubuntu系统python3.10安装playhouse三方库 问题描述 问题描述 虚拟环境中使用pip install playhouse,返回安装成功 用pip list查看,能看到playhouse及版本号 导包时提示没有找到playhouse我那件目录,能发现 检查site-package发现问题&#x…...

【星云 Orbit-F4 开发板】04.一触即发:GPIO 外部中断
【星云 Orbit-F4 开发板】04. 一触即发:外部中断控制 摘要 本文详细介绍了如何使用STM32F407微控制器的HAL库实现外部中断功能。通过配置GPIO引脚作为外部中断源,并在中断回调函数中处理按键事件,实现了按键控制LED状态翻转的功能。本文旨在…...

笔记二:整数和浮点数在内存中存储
目录 一、数据类型介绍 二、类型的基本归类 1.整形家族: 2.浮点数家族: 3.构造类型: 4.指针类型 5.空类型: 三、整形在内存中的存储 3.1 原码,反码、补码 3.2 大小端介绍 四、浮点数在内存中的存储 编辑 4.…...

PyQT(PySide)的上下文菜单策略设置setContextMenuPolicy()
在 Qt 中,QWidget 类提供了几种不同的上下文菜单策略,这些策略通过 Qt::ContextMenuPolicy 枚举类型来定义,用于控制控件(如按钮、文本框等)在用户右键点击时如何显示上下文菜单。 以下是 Qt::ContextMenuPolicy 枚举中…...

BladeX框架接口请求跨域
前端使用代理请求接口,接口可以正常访问。如果换全路径请求就跨域。 除了后端要配置跨域 还需要修改配置文件对OPTIONS请求的限制...

如何在Apple不再支持的MacOS上安装Homebrew
手头有一台2012年产的Macbook Pro,系统版本停留在了10.15.7(2020年9月24日发布的)。MacOS 11及后续的版本都无法安装到这台老旧的电脑上。想通过pkg安装Homebrew,发现Homebrew releases里最新的pkg安装包不支持MacOS 10.15.7&…...

本地大模型编程实战(26)用langgraph实现基于SQL数据构建的问答系统(5)
本文将将扩展上一篇文章完成的 langgraph 链,继续使用基于 langgraph 链 ,对结构化数据库 SQlite 进行查询的方法。该系统建立以后,我们不需要掌握专业的 SQL 技能,可以用自然语言询问有关数据库中数据的问题并返回答案。主要完善…...
数据结构与算法:滑动窗口
前言 滑动窗口一般主要用于解决子数组或子串问题,这类的题目更看重对题目的分析和转化。 一、原理 在整个数组上,用l和r分别控制窗口的左右边界,r就扩大,l就减小。 当窗口的范围和题目中某个指标间存在单调关系时,…...

江协科技/江科大-51单片机入门教程——P[2-1] 点亮一个LED
本节将向大家介绍如何用 51 单片机去控制开发板上的 LED。开发板上的 LED 位置标注有 “LED 模块”。 第二章要写 3 个程序代码:第一个代码实现点亮开发板上的第一个 LED;第二个代码让第一个 LED 以 1 秒为周期闪烁;第三个代码使 8 个 LED 以…...
leetcode hot 100 41. 缺失的第一个正数
代码 测试用例 测试用例 测试结果 41. 缺失的第一个正数 已解答 困难 相关标签 相关企业 提示 给你一个未排序的整数数组 nums ,请你找出其中没有出现的最小的正整数。 请你实现时间复杂度为 O(n) 并且只使用常数级别额外空间的解决方案。 示例 1…...
UniApp 使用 u-loadmore 完整步骤
文章目录 一、前期准备1. 安装 uView - UI 二、使用 u-loadmore组件1. 创建页面2. 编写页面代码模板部分(loadmore-demo.vue)样式部分脚本部分 三、要点补充1. u-loadmore 状态说明2. 数据请求优化3. 性能优化4. 兼容性问题 在 UniApp 开发中,…...

设置电脑一接通电源就主动开机
文章目录 1、进入BIOS2、设置4、功能弊端5、电脑自动开机的设置 1、进入BIOS 在电脑重启时,这时屏幕上会显示按XXX键到BIOS界面 没有进入BIOS提示的,按下面方法操作: 方法一 在开机显示logo的时候,立即按下面这几个按键…...

使用VSCode开发Django指南
使用VSCode开发Django指南 一、概述 Django 是一个高级 Python 框架,专为快速、安全和可扩展的 Web 开发而设计。Django 包含对 URL 路由、页面模板和数据处理的丰富支持。 本文将创建一个简单的 Django 应用,其中包含三个使用通用基本模板的页面。在此…...
【Linux】shell脚本忽略错误继续执行
在 shell 脚本中,可以使用 set -e 命令来设置脚本在遇到错误时退出执行。如果你希望脚本忽略错误并继续执行,可以在脚本开头添加 set e 命令来取消该设置。 举例1 #!/bin/bash# 取消 set -e 的设置 set e# 执行命令,并忽略错误 rm somefile…...

中南大学无人机智能体的全面评估!BEDI:用于评估无人机上具身智能体的综合性基准测试
作者:Mingning Guo, Mengwei Wu, Jiarun He, Shaoxian Li, Haifeng Li, Chao Tao单位:中南大学地球科学与信息物理学院论文标题:BEDI: A Comprehensive Benchmark for Evaluating Embodied Agents on UAVs论文链接:https://arxiv.…...

大型活动交通拥堵治理的视觉算法应用
大型活动下智慧交通的视觉分析应用 一、背景与挑战 大型活动(如演唱会、马拉松赛事、高考中考等)期间,城市交通面临瞬时人流车流激增、传统摄像头模糊、交通拥堵识别滞后等问题。以演唱会为例,暖城商圈曾因观众集中离场导致周边…...

【SQL学习笔记1】增删改查+多表连接全解析(内附SQL免费在线练习工具)
可以使用Sqliteviz这个网站免费编写sql语句,它能够让用户直接在浏览器内练习SQL的语法,不需要安装任何软件。 链接如下: sqliteviz 注意: 在转写SQL语法时,关键字之间有一个特定的顺序,这个顺序会影响到…...
【论文笔记】若干矿井粉尘检测算法概述
总的来说,传统机器学习、传统机器学习与深度学习的结合、LSTM等算法所需要的数据集来源于矿井传感器测量的粉尘浓度,通过建立回归模型来预测未来矿井的粉尘浓度。传统机器学习算法性能易受数据中极端值的影响。YOLO等计算机视觉算法所需要的数据集来源于…...
工业自动化时代的精准装配革新:迁移科技3D视觉系统如何重塑机器人定位装配
AI3D视觉的工业赋能者 迁移科技成立于2017年,作为行业领先的3D工业相机及视觉系统供应商,累计完成数亿元融资。其核心技术覆盖硬件设计、算法优化及软件集成,通过稳定、易用、高回报的AI3D视觉系统,为汽车、新能源、金属制造等行…...

使用 SymPy 进行向量和矩阵的高级操作
在科学计算和工程领域,向量和矩阵操作是解决问题的核心技能之一。Python 的 SymPy 库提供了强大的符号计算功能,能够高效地处理向量和矩阵的各种操作。本文将深入探讨如何使用 SymPy 进行向量和矩阵的创建、合并以及维度拓展等操作,并通过具体…...
Java 二维码
Java 二维码 **技术:**谷歌 ZXing 实现 首先添加依赖 <!-- 二维码依赖 --><dependency><groupId>com.google.zxing</groupId><artifactId>core</artifactId><version>3.5.1</version></dependency><de…...

JVM虚拟机:内存结构、垃圾回收、性能优化
1、JVM虚拟机的简介 Java 虚拟机(Java Virtual Machine 简称:JVM)是运行所有 Java 程序的抽象计算机,是 Java 语言的运行环境,实现了 Java 程序的跨平台特性。JVM 屏蔽了与具体操作系统平台相关的信息,使得 Java 程序只需生成在 JVM 上运行的目标代码(字节码),就可以…...