spark core 加强版
发布时间
阅读量:
阅读量
RDD的持久化

RDD缓存
当某个RDD被频繁调用时,在其容易出现错误的情况下,并且因为占用较多资源和时间而难以处理时,则可以选择缓存该RDD
主要功能: 优化Spark程序的计算性能
注意事项: RDD的数据可以选择性地存储于内存或磁盘上;此外,在Executor进程的堆外内存中也可实现相应的缓存功能。其中,默认策略会将数据集中于内存区域;但由于其存在一定的不稳定性。
临时存储的性质可能导致数据可能被丢失
设置缓存的API:
rdd.cache(): 将RDD的数据缓存储内存中
rdd.persist(缓存的级别/位置): 将RDD的数据存储在指定位置
手动清理缓存API:
rdd.unpersist()
默认情况下,当整个Spark应用程序执行完成后,缓存数据会自动失效,会被自动删除
缓存的级别/位置:
DISK_ONLY: 只存储在磁盘
DISK_ONLY_2: 只存储在磁盘,并且有2个副本
DISK_ONLY_3:
全部评论 (0)
还没有任何评论哟~
