1).什么是RDD?
弹式分布数据集(Resilient distributed Dataset)
2).RDD的五大特性?
1.RDD是由一系列的partition组成的
2.RDD之间具有依赖关系
3.RDD作用在partition是上
4.partition作用在具有(k,v)格式的数据集
5.partition对外提供最佳计算位置,利于数据本地化的处理
3).Spark RDD需要注意的问题
1.textFile方法底层封装的是读取方法和MR读取文件的方式一样,读取文件之前先split,默认split大小是一个block大小。
2.RDD**实际上不存储数据(partition其实也不存储数据),
3.什么是K,V格式的RDD?
Ø 如果RDD里面存储的数据都是二元组对象,那么这个RDD我们就叫做K,V格式的RDD。
4. 哪里体现RDD的弹性(容错)?
Ø partition数量,可多可少,体现了RDD的弹性。
Ø RDD之间具有依赖关系,可以基于上一个RDD重新计算出RDD。
5.哪里体现RDD的分布式?
Ø RDD是由Partition组成,partition是分布在不同节点上的。
版权声明:本文内容由互联网用户自发贡献,该文观点与技术仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容, 请发送邮件至 [email protected] 举报,一经查实,本站将立刻删除。