当前位置：首页 > news >正文

Spark on Yarn安装配置,大数据技能竞赛（容器环境）

news 2025/11/9 5:26:39

Spark on Yarn模式，即把Spark作为一个客户端，将作业提交给Yarn服务，由于在生产环境中，很多时候都要与Hadoop使用同一个集群，因此采用Yarn来管理资源调度，可以有效提高资源利用率。

环境说明：

服务端登录地址详见各任务服务端说明。
补充说明：宿主机可通过Asbru工具或SSH客户端进行SSH访问；
相关软件安装包在宿主机的/opt目录下，请选择对应的安装包进行安装，用不到的可忽略；
所有任务中应用命令必须采用绝对路径；
进入Master节点的方式为
docker exec -it master /bin/bash
进入Slave1节点的方式为
docker exec -it slave1 /bin/bash
进入Slave2节点的方式为
docker exec -it slave2 /bin/bash
三个容器节点的root密码均为123456

提前准备好spark-3.1.1-bin-hadoop3.2.tgz 放在宿主机的/opt/下（模拟的自己准备，比赛时会提供）

Hadoop 完全分布式安装配置

环境搭建请看这篇文章大数据模块A环境搭建

前提条件已经在容器里搭建完hadoop了,没搭建的请看这篇Hadoop 完全分布式安装配置

Spark on Yarn安装配置

本任务需要使用root用户完成相关配置，已安装Hadoop及需要配置前置环境，具体要求如下：

1、从宿主机/opt目录下将文件spark-3.1.1-bin-hadoop3.2.tgz复制到容器Master中的/opt/software（若路径不存在，则需新建）中，将Spark包解压到/opt/module路径中(若路径不存在，则需新建)，将完整解压命令复制粘贴至客户端桌面【Release\任务A提交结果.docx】中对应的任务序号下；

第一步：从宿主机/opt目录下将文件spark-3.1.1-bin-hadoop3.2.tgz复制到容器Master中的/opt/software（若路径不存在，则需新建）中

[root@Bigdata ~]# docker cp /opt/spark-3.1.1-bin-hadoop3.2.tgz master:/opt/software

第二步：将Spark包解压到/opt/module路径中(若路径不存在，则需新建)

[root@master ~]# tar zxvf /opt/software/spark-3.1.1-bin-hadoop3.2.tgz -C /opt/module/
[root@master ~]# mv /opt/module/spark-3.1.1-bin-hadoop3.2 /opt/module/spark

2、修改容器中/etc/profile文件，设置Spark环境变量并使环境变量生效，在/opt目录下运行命令spark-submit --version，将命令与结果截图粘贴至客户端桌面【Release\任务A提交结果.docx】中对应的任务序号下；

第一步：修改容器中/etc/profile文件，设置Spark环境变量

#SPARK_HOME
export SPARK_HOME=/opt/module/spark
export PATH=$PATH:$SPARK_HOME/binc

第二步：使环境变量生效

[root@master ~]# source /etc/profile

第三步：在/opt目录下运行命令spark-submit --version

[root@master ~]# cd /opt/
[root@master opt]# spark-submit --version
Welcome to____              __/ __/__  ___ _____/ /___\ \/ _ \/ _ `/ __/  '_//___/ .__/\_,_/_/ /_/\_\   version 3.1.1/_/Using Scala version 2.12.10, Java HotSpot(TM) 64-Bit Server VM, 1.8.0_212
Branch HEAD
Compiled by user ubuntu on 2021-02-22T01:33:19Z
Revision 1d550c4e90275ab418b9161925049239227f3dc9
Url https://github.com/apache/spark
Type --help for more information.
[root@master opt]#

3、完成on yarn相关配置，使用spark on yarn 的模式提交$SPARK_HOME/examples/jars/spark-examples_2.12-3.1.1.jar 运行的主类为org.apache.spark.examples.SparkPi，将运行结果截图粘贴至客户端桌面【Release\任务A提交结果.docx】中对应的任务序号下（截取Pi结果的前后各5行）。

（运行命令为：spark-submit --master yarn --class org.apache.spark.examples.SparkPi $SPARK_HOME/examples/jars/spark-examples_2.12-3.1.1.jar）

第一步：完成on yarn相关配置

修改hadoop配置文件/opt/module/hadoop/etc/hadoop/yarn-site.xml

<!--是否启动一个线程检查每个任务正使用的物理内存量，如果任务超出分配值，则直接将其杀掉，默认是true -->
<property>
<name>yarn.nodemanager.pmem-check-enabled</name>
<value>false</value>
</property>
<!--是否启动一个线程检查每个任务正使用的虚拟内存量，如果任务超出分配值，则直接将其杀掉，默认是true -->
<property>
<name>yarn.nodemanager.vmem-check-enabled</name>
<value>false</value>
</property>

发到其他节点（slave1，slave2）

[root@master ~]# scp /opt/module/hadoop/etc/hadoop/yarn-site.xml slave1:/opt/module/hadoop/etc/hadoop/yarn-site.xml 
[root@master ~]# scp /opt/module/hadoop/etc/hadoop/yarn-site.xml slave2:/opt/module/hadoop/etc/hadoop/yarn-site.xml

复制一份spark-env.sh

[root@master ~]# cp /opt/module/spark/conf/spark-env.sh.template /opt/module/spark/conf/spark-env.sh

修改/opt/module/spark/conf/spark-env.sh，添加JAVA_HOME、YARN_CONF_DIR和HADOOP_CONF_DIR配置

[root@master ~]# vi /opt/module/spark/conf/spark-env.sh

export JAVA_HOME=/opt/module/java
export YARN_CONF_DIR=/opt/module/hadoop/etc/hadoop
export HADOOP_CONF_DIR=/opt/module/hadoop/etc/hadoop

启动Hadoop集群

start-all.sh

确保 /user/root/ 和 /user/root/.sparkStaging/ 目录有足够的权限。

hdfs dfs -chmod -R 777 /user/root

第二步：使用spark on yarn 的模式提交$SPARK_HOME/examples/jars/spark-examples_2.12-3.1.1.jar 运行的主类为org.apache.spark.examples.SparkPi

spark-submit --master yarn --class org.apache.spark.examples.SparkPi  $SPARK_HOME/examples/jars/spark-examples_2.12-3.1.1.jar

截取Pi结果的前后各5行

声明：此文章为个人学习笔记，如文章有问题欢迎留言探讨，也希望您的指正！

Spark on Yarn安装配置,大数据技能竞赛（容器环境）

Spark on Yarn模式，即把Spark作为一个客户端，将作业提交给Yarn服务，由于在生产环境中，很多时候都要与Hadoop使用同一个集群，因此采用Yarn来管理资源调度，可以有效提高资源利用率。环境说明： 服…...

编程日记 2024/12/9 13:24:14

遣其欲，而心自静 -- 33DAI

显然，死做枚举只能的50分。错了4次总算对了。大体思路： 因题目说只有两个因数，那么有两种情况： 1：两个质数相乘，如：3*515 5*745 等（不包括5*525 或5*315 重复计算\ 因为3*5算了…...

编程日记 2024/12/9 13:22:10

No.25 笔记 | 信息收集与Google语法的实践应用

什么是信息收集？ 信息收集（Information Gathering）是渗透测试的第一步，其目的是通过各种手段收集目标的漏洞和弱点，为后续的攻击策略提供依据。正所谓“知己知彼，百战百胜”，信息收集的重要性…...

编程日记 2024/12/9 13:21:09

GitLab基础环境部署：Ubuntu 22.04.5系统在线安装GitLab 17.5.2实操手册

文章目录 GitLab基础环境部署：Ubuntu 22.04.5系统在线安装GitLab 17.5.2实操手册一、环境准备1.1 机器规划1.2 环境配置1.2.1 设置主机名1.2.2 停止和禁用防火墙1.2.3 更新系统二、GitLab安装配置2.1 安装GitLab所需的依赖包2.2 添加GitLab存储库2.2.1 将GitLab存储…...

编程日记 2024/12/9 13:18:04

SpringBoot3配置文件

一、统一配置管理概述: SpringBoot工程下，进行统一的配置管理，你想设置的任何参数(端口号、项目根路径、数据库连接信息等等)都集中到一个固定位置和命名的配置文件(application.properties或application.yml)中配置文件应该放置在Spring Boot工程的s…...

编程日记 2024/12/9 13:17:03

【机器学习】任务十二：循环神经网络

1.循环神经网络 1.1 什么是循环神经网络（RNN）？ 循环神经网络（Recurrent Neural Network, RNN） 是一种用于处理序列数据的神经网络类型，它的主要特点是拥有循环连接，使得网络可以对序列中的每个…...

编程日记 2024/12/9 13:12:57

【返璞归真】-切比雪夫不等式（Chebyshev‘s Inequality）

切比雪夫不等式（Chebyshev’s Inequality） 切比雪夫不等式是概率论中的一个基本不等式，用于估计随机变量偏离其期望值一定范围的概率。它对于任何具有有限期望和有限方差的随机变量都成立。公式表达切比雪夫不等式的基本形式如下&#xf…...

编程日记 2024/12/9 13:11:56

【Django】在view中调用channel来主动进行websocket通信

前提：consumer中已经写好了建立连接的代码，并且能够成功把连接加入到通道层的组内可以参考我的另一个博客： LuckySheet协同编辑后端示例(DjangoChannel,Websocket通信)_lucksheet 协同编辑-CSDN博客我是懒得去折腾luckysheet的源码&…...

编程日记 2024/12/9 13:10:55

18.[极客大挑战 2019]BabySQL1

进入靶场随便输输再输输可以判断是单引号闭合再随便输输查询字段数量得，过滤了关键字也过滤了只能双写了根据回显，这样可以，只是需要改改 1,2不行 1,2,3行 1,2,3,4不行可以尝试得到库名，表名了库名 database(…...

编程日记 2024/12/9 13:09:53

Python快速入门二：Python3 基础语法

一、编码默认情况下，Python 3 源码文件以 UTF-8 编码，所有字符串都是 unicode 字符串。当然你也可以为源码文件指定不同的编码： # -*- coding: cp-1252 -*-上述定义允许在源文件中使用 Windows-1252 字符集中的字符编码，对应适…...

编程日记 2024/12/9 13:08:52

1-1 C语言链表

目录目录 1.0 定义 2.0 为什么使用链表 3.0 链表原理 4.0 创建链表节点 5.0 链表原理续 6.0 链表实现 6.0.1 创建节点 6.0.2 初始化链表 6.0.3 添加链表节点 6.0.4 循环遍历 6.0.5 插入节点 6.0.6 插入头结点main函数 7.0 完整代码 8.0 节点添加方案二 8.0.1 …...

编程日记 2024/12/9 13:05:49

[0629].第29节：配置中心业务规则与动态刷新

我的后端学习大纲 SpringCloud学习大纲 1、编码实现3377服务： 1.1.建module: 1.2.改pom: 1.3.写YML： 1.Nacos同Consul一样，在项目初始化时，要保证先从配置中心进行配置拉取，拉取配置之后，才能保证项目的正…...

编程日记 2024/12/9 13:02:46

mac: docker : Command not found解决

描述: 安装docker但是docker命令显示Command not found 分析: mac没有配置对应的环境变量解决方案: 打开配置文件: vim ~/.zshrc写docker环境变量: export PATH"/Applications/Docker.app/Contents/Resources/bin:$PATH"保存退出: esc,输入wq,按enter 配置文…...

编程日记 2024/12/9 13:00:44

1. 注册 # settings.pyINSTALLED_APPS [,rest_framework, ]2. 路由 from django.urls import pathurlpatterns [path(task/, views.TaskAPIView.as_view()) ]3. 视图 from rest_framework.views import APIView from rest_framework.response import Responseclass TaskAPIV…...

编程日记 2024/12/9 12:57:39

Spark on Yarn安装配置,大数据技能竞赛（容器环境）

Hadoop 完全分布式安装配置

Spark on Yarn安装配置

相关文章：

Spark on Yarn安装配置,大数据技能竞赛（容器环境）

遣其欲，而心自静 -- 33DAI

No.25 笔记 | 信息收集与Google语法的实践应用

GitLab基础环境部署：Ubuntu 22.04.5系统在线安装GitLab 17.5.2实操手册

SpringBoot3配置文件

【机器学习】任务十二：循环神经网络

【返璞归真】-切比雪夫不等式（Chebyshev‘s Inequality）

【Django】在view中调用channel来主动进行websocket通信

18.[极客大挑战 2019]BabySQL1

Python快速入门二：Python3 基础语法

1-1 C语言链表

[0629].第29节：配置中心业务规则与动态刷新

mac: docker : Command not found解决

Django drf基于APIView 快速使用

【MarsCode】每日一题数组之数字分组求偶数和

解决：error: subprocess-exited-with-error 的问题

使用腾讯混元(HunYuanVideo)视频模型FP8量化版本来生成绅士动画,模型体积30G,8G甜品卡可玩,2秒视频需要15分钟

使用Ancona安装node，安装vue

如何“安装Android SDK“？

天童教育：提升孩子的语言表达能力

Java - Mysql数据类型对应

高危文件识别的常用算法：原理、应用与企业场景

[Java恶补day16] 238.除自身以外数组的乘积

ABAP设计模式之---“简单设计原则(Simple Design)”

HDFS分布式存储 zookeeper

Mysql中select查询语句的执行过程

0x-3-Oracle 23 ai-sqlcl 25.1 集成安装-配置和优化

从物理机到云原生：全面解析计算虚拟化技术的演进与应用

Linux安全加固：从攻防视角构建系统免疫

深入理解 React 样式方案