Thursday, March 24, 2022

Partitioning in Apache Spark

 

Partitioning in Apache Spark

Two types of partitioning:

p=key.hashCode() %noOfPartitions
Performance gain when data was partitioned before applying the transformation.

How to partition your RDD

val pairRDD = data.map(x =>(x.key,x.value));
val partitioner = new RangePartitioner(8,pairRDD) ;
val partitionedRDD = pairRDD.partitionBy(partitioner).persist();

Why partition data?

Figure 3

No comments: