微信公众号搜"智元新知"关注
微信扫一扫可直接关注哦!

Spark中的RDD是什么,有哪些特性?

1).什么是RDD?

       弹式分布数据集(Resilient distributed Dataset)

2).RDD的五大特性?

       1.RDD是由一系列的partition组成的

       2.RDD之间具有依赖关系

       3.RDD作用在partition是上

       4.partition作用在具有(k,v)格式的数据集

       5.partition对外提供最佳计算位置,利于数据本地化的处理

3).Spark RDD需要注意的问题

       1.textFile方法底层封装的是读取方法和MR读取文件的方式一样,读取文件之前先split,认split大小是一个block大小。

       2.RDD**实际上不存储数据(partition其实也不存储数据),

       3.什么是K,V格式的RDD?

              Ø 如果RDD里面存储的数据都是二元组对象,那么这个RDD我们就叫做K,V格式的RDD。

       4. 哪里体现RDD的弹性(容错)?

              Ø partition数量,可多可少,体现了RDD的弹性。

              Ø RDD之间具有依赖关系,可以基于上一个RDD重新计算出RDD。

       5.哪里体现RDD的分布式?

              Ø RDD是由Partition组成,partition是分布在不同节点上的。

版权声明:本文内容由互联网用户自发贡献,该文观点与技术仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容, 请发送邮件至 [email protected] 举报,一经查实,本站将立刻删除。

相关推荐