当前位置：首页 > news >正文

Spark+实例解读

news 2026/5/11 23:49:04

第一部分 Spark入门

学习教程：Spark 教程 | Spark 教程

Spark 集成了许多大数据工具，例如 Spark 可以处理任何 Hadoop 数据源，也能在 Hadoop 集群上执行。大数据业内有个共识认为，Spark 只是Hadoop MapReduce 的扩展（事实并非如此），如Hadoop MapReduce 中没有的迭代查询和流处理。然而Spark并不需要依赖于 Hadoop，它有自己的集群管理系统。更重要的是，同样数据量，同样集群配置，Spark 的数据处理速度要比 Hadoop MapReduce 快10倍左右。

Spark 的一个关键的特性是数据可以在内存中迭代计算，提高数据处理的速度。虽然Spark是用 Scala开发的，但是它对 Java、Scala、Python 和 R 等高级编程语言提供了开发接口。

第二部分 SparkCore

2 RDD

2.1 转换算子-map

map是将RDD的数据一条条处理，返回新的RDD

# 定义方法
def add(data):return data*10
print(rdd.map(add).collect)
# 定义lamabda表达式
rdd.map(lambda data:data*10)

2.2 转换算子-flatMap

flatMap对RDD执行map操作,然后执行解除嵌套操作

rdd = sc.parallelize([('a',1),('a',11)])
# 将二元元组的所有value都*10进行处理
rdd.mapValues(lambda x:x*10)

    data.map { case (label, feature) => ((feature, label), 1)}.reduceByKey(_ + _).map { case ((feature, label), num) =>(feature, List((label, num))) //feature,label,cnt}.reduceByKey(_ ::: _).mapValues { x =>val size_entro = x.map(_._2).sumval res = x.map(_._2.toDouble / size_entro).map { t =>-t * (Math.log(t) / Math.log(2))}.sumsize_entro * res}.mapValues { x => x / size }.map(_._2).sum

2.3转换算子-reduceByKey

针对KV型RRDD自动按照key进行分组,然后按照提供的聚合逻辑,对组内数据value完成聚合操作

rdd.reduceByKey(func)

      val clickStat = joinDf.where(F.col("active_type")==="click").rdd.map(row => {val mapInfo = Option(row.getMap[String,Double](row.fieldIndex(feat)))mapInfo match {case Some(x) => xcase _ => null}}).filter(_!=null).flatMap(x=>x).reduceByKey(_+_)

2.4 转换算子-mapValues

针对二元元组RDD,对其内部的二元元组的value进行map操作

rdd = sc.parallelize([('a',1),('a',11)])
# 将二元元组的所有value都*10进行处理
rdd.mapValues(lambda x:x*10)

    data.map { case (label, feature) => ((feature, label), 1)}.reduceByKey(_ + _).map { case ((feature, label), num) =>(feature, List((label, num))) //feature,label,cnt}.reduceByKey(_ ::: _).mapValues { x =>val size_entro = x.map(_._2).sumval res = x.map(_._2.toDouble / size_entro).map { t =>-t * (Math.log(t) / Math.log(2))}.sumsize_entro * res}.mapValues { x => x / size }.map(_._2).sum

2.5 转换算子-groupBy

将RDD的数据进行分组

rdd.groupBy(func)

rdd = sc.parallelize([('a',1),('a',11),('b',1)])
# 通过这个函数确认按照谁来分组(返回谁即可)
print(rdd.groupBy(lambda x:x[0]).collect())
print(rdd.groupBy(lambda x:x[0]).collect())
# 结果为:

    val userContentListHis = spark.thriftSequenceFile(inpath_his, classOf[LongVideoUserContentStat]).map(l=>{(l.getUid,l.getContent_properties.get(0).getId)}).toDF("uid", "docid").groupBy($"uid")

2.6 转换算子-filter

过滤想要的数据进行保存

rdd = sc.parallelize([1,2,3,4,5,6])
rdd.filter(lamdba x:x%2 == 1) # 只保留奇数

    val treatmentUser = spark.read.option("header", false).option("sep", "\t").csv(inpath).select("_c0").withColumnRenamed("_c0", "userid").withColumn("flow", getexpId($"userid")).filter($"flow" >= start and $"flow" <= end).select("userid").dropDuplicates()

2.7 转换算子-其他算子

distinct算子
rdd.distinct() 一般不写去重分区val userContentHis = hisPathList.map(path =>{val hisData = spark.thriftSequenceFile(path, classOf[LongVideoUserContentStat])println(s"hisData ==>${hisData.count()}")hisData}).reduce(_ union _).distinct().repartition(partition)

union算子 
2个rdd合并成一个rdd:rdd.union(other_rdd)
只合并不去重  rdd的类型不同也是可以合并的
rdd1 = sc.parallelize([1,2,3])
rdd2 = sc.parallelize([1,2,3,4])
rdd3 = rdd1.union(rdd2)

2.8 算子面试题

1.groupByKey和reduceByKey的区别:
groupByKey仅仅有分组功能而已,reduceByKey除了分组还有聚合作用,是一个分组+聚合一体化的算子. 分组前先聚合再shuffle,预聚合,被shuffle的数据极大的减少,提升了性能.数据量越大,reduceByKey的性能优势也就越大.

2.rdd的分区数怎么查看? 
通过getNumPartitions API查看,返回int

3.Transformation和Action的区别:
转换算子的返回值100%是rdd,而Action算子不一定.转换算子是懒加载的,只有遇到Action才会执行

4.哪两个算子不经过Driver直接输出?
foreach 和 saveAsTextFile

3 RDD的持久化

3.1 RDD的持久化

rdd是过程数据 rdd进行相互迭代计算,执行开启时,新的RDD生成,老的RDD消失

3.2 RDD的缓存

val rawLog = profilePushLogReader(spark, date, span).persist()

3.3 RDD的checkPoint

也是将RDD的数据保存起来,仅支持磁盘存储,被认为是安全的, 不保留血缘关系

3.4 缓存面试题

4 案例

4.1 搜素引擎日志分析案例

4.2 4.3 ....

4.4 计算资源面试题

1.如何尽量提升任务计算的资源？
计算cpu核心和内存量，通过--executor-memory指定executor内存，通过--executor-cores指定executor的核心数

5 广播变量累加器

Spark+实例解读

第一部分 Spark入门学习教程：Spark 教程 | Spark 教程 Spark 集成了许多大数据工具，例如 Spark 可以处理任何 Hadoop 数据源，也能在 Hadoop 集群上执行。大数据业内有个共识认为，Spark 只是Hadoop MapReduce 的扩展&#xff08…...

编程日记 2024/7/30 12:43:23

WPF多语言国际化，中英文切换

通过切换资源文件的形式实现中英文一键切换在项目中新建Language文件夹，添加资源字典（xaml文件），中文英文各一个。在资源字典中写上想中英文切换的字符串，需要注意，必须指定key值，并且中英文…...

编程日记 2024/7/30 12:41:20

Halcon深度学习分类模型

1.Halcon20之后深度学习支持CPU训练模型，没有money买显卡的小伙伴有福了。但是缺点也很明显，就是训练速度超级慢，推理效果也没有GPU好，不过学习用足够。 2.分类模型是Halcon深度学习最简单的模型，可以用在物品分类&…...

编程日记 2024/7/30 12:40:19

洗地机哪种牌子好？洗地机排行榜前十名公布

洗地机市场上品牌琳琅满目，每个品牌都有其独特的魅力和优势。消费者在选择时，往往会根据自己的实际需求、预算以及对产品性能的期望来做出决策。因此，无论是哪个品牌的洗地机，只要能够满足用户的清洁需求，提供便捷的操…...

编程日记 2024/7/30 12:38:17

C++中的虚函数与多态机制如何工作？

在C中，虚函数和多态机制是实现面向对象编程的重要概念。虚函数是在基类中声明的函数，可以在派生类中进行重写。当基类的指针或引用指向派生类的对象时，通过调用虚函数可以实现动态绑定，即在运行时确定要调用的函数。多态是指通…...

编程日记 2024/7/30 12:37:12

《LeetCode热题100》---＜哈希三道＞

本篇博客讲解 LeetCode热题100道中的哈希篇中的三道题。分别是 1.第一道：两数之和（简单） 2.第二道：字母异位词分组（中等） 3.第三道：最长连续序列（中等） 第一道&#xff1…...

编程日记 2024/7/30 12:35:10

秒懂C++之string类（下）

目录一.接口说明 1.1 erase 1.2 replace（最好别用） 1.3 find 1.4 substr 1.5 rfind 1.6 find_first_of 1.7 find_last_of 二.string类的模拟实现 2.1 构造 2.2 无参构造 2.3 析构 2.4.【】运算符 2.5 迭代器 2.6 打印 2.7 reserve扩容 …...

编程日记 2024/7/30 12:32:07

github简单地操作

1.调节字体大小选择options 选择text 选择select 选择你需要的参数就可以了。 2.配置用户名和邮箱桌面右键，选择git Bash Here git config --global user.name 用户名 git config --global user.email 邮箱名 3.用git实现代码管理的过程下载别人的项目 git …...

编程日记 2024/7/30 12:30:05

模型改进-损失函数合集

模版第一步在哪些地方做出修改： 228行 self.use_wiseiouTrue 230行 self.wiou_loss WiseIouLoss(ltypeMPDIoU, monotonousFalse, inner_iouTrue, focaler_iouFalse) 238行 wiou self.wiou_loss(pred_bboxes[fg_mask], target_bboxes[fg_mask], ret_iouFalse…...

编程日记 2024/7/30 12:29:03

C++模板（初阶）

1.引入在之前的笔记中有提到：函数重载（特别是交换函数（Swap）的实现） void Swap(int& left, int& right) {int temp left;left right;right temp; } void Swap(double& left, double& right) {do…...

编程日记 2024/7/30 12:28:01

下面关于Date类的描述错误的一项是？

下面关于Date类的描述错误的一项是？ A. java.util.Date类下有三个子类：java.sql.Date、java.sql.Timestamp、java.sql.Time； B. 利用SimpleDateFormat类可以对java.util.Date类进行格式化显示； C. 直接输出Date类对象就可以取得日…...

编程日记 2024/7/30 12:27:00

【Python面试题收录】Python编程基础练习题①（数据类型+函数+文件操作）

本文所有代码打包在Gitee仓库中https://gitee.com/wx114/Python-Interview-Questions 一、数据类型第一题（str） 请编写一个Python程序，完成以下任务： 去除字符串开头和结尾的空格。使用逗号（","&#…...

编程日记 2024/7/30 12:25:59

C# Nmodbus,EasyModbusTCP读写操作

Nmodbus读写两个Button控件分别为读取和写入分别使用控件的点击方法 ①引用第三方《NModbus4》2.1.0版本全局 public SerialPort port new SerialPort("COM2", 9600, Parity.None, 8, (StopBits)1); ModbusSerialMaster master; public Form1() port.Open();…...

编程日记 2024/7/30 12:24:58

spark常用参数调优

目录 1.set spark.grouping.sets.reference.hivetrue;2.set spark.locality.wait.rack0s3.set spark.locality.wait0s;4.set spark.executor.memoryOverhead 2G;5.set spark.sql.shuffle.partitions 1000;6.set spark.shuffle.file.buffer 256k7. set spark.reducer.maxSizeInF…...

编程日记 2024/7/30 12:20:55