Advertisement

spark core 加强版

阅读量:

RDD的持久化

在这里插入图片描述

RDD缓存

当某个RDD被频繁调用时,在其容易出现错误的情况下,并且因为占用较多资源和时间而难以处理时,则可以选择缓存该RDD

主要功能: 优化Spark程序的计算性能
注意事项: RDD的数据可以选择性地存储于内存或磁盘上;此外,在Executor进程的堆外内存中也可实现相应的缓存功能。其中,默认策略会将数据集中于内存区域;但由于其存在一定的不稳定性。

临时存储的性质可能导致数据可能被丢失

复制代码
    设置缓存的API: 
    	rdd.cache(): 将RDD的数据缓存储内存中
    	rdd.persist(缓存的级别/位置): 将RDD的数据存储在指定位置
    
    手动清理缓存API:
    	rdd.unpersist()
    默认情况下,当整个Spark应用程序执行完成后,缓存数据会自动失效,会被自动删除
    
    缓存的级别/位置:
    DISK_ONLY: 只存储在磁盘
    DISK_ONLY_2: 只存储在磁盘,并且有2个副本
    DISK_ONLY_3: 

全部评论 (0)

还没有任何评论哟~