您的位置：首页 > 其它

spark新能优化之多次使用RDD的持久化或checkPoint

2016-07-13 17:47 253 查看

如果程序中，对某一个RDD，基于它进行了多次transformation或者action操作。那么就非常有必要对其进行持久化操作，以避免对一个RDD反复进行计算。

此外，如果要保证在RDD的持久化数据可能丢失的情况下，还要保证高性能，那么可以对RDD进行Checkpoint操作。（也就是多次用到中间RDD的生成值时可以持久化再checkPoint（当持久化数据没的时候会去checkPoint中寻找，详细见spark源码。））

内容来自用户分享和网络整理，不保证内容的准确性，如有侵权内容，可联系管理员处理

标签：

相关文章推荐

以SpringMVC框架为中心疯狂扩展-03、添加springframework的依赖
AARRR：互联网创业者一定要掌握的指标
OpenSSLRSA.h
Git 常用操作
oracle客户端精简绿色版-环境变量配置
log4j.properties配置详解
HTML5+、mui开发移动app
php常用加密技术（包括密码加密及URL加密）
NYOJ-开灯问题
实习期间移动端做时总结
BZOJ3548 : [ONTAK2010]Party
JAVA-实用类
css3变形中几个重要点
从Dinnr失败看产品市场可行性认知有哪些不足
strace，truss，ltrace追踪系统情况
关于Android的内存泄露的笔记
Sphinx 搜索引擎 MySql多表上亿大数据飞速执行的福音 SphinxQL像使用SQL一样使用
ajax传递给后台数组参数方式
java 文件复制文件夹复制工具类
MPU6050数据读取

新的分享

一次教科书级别的Redis高可用架构设计实践 - Redis
曾光：北京这次的毒株不像国内流行类型
从PRD文档到产品上线，有哪些问题需要解决？
vue3自定义指令的使用
Oracle SQL性能优化最常用的40条建议 - ORACLE
程序员翻车常见反应，你中枪了吗？ - 职场生涯
新鲜开源：基于Prometheus的企业监控平台设计与实现 - 运维
嵌入式软件开发之程序架构设计-任务调度
【Java面试】请简单说一下你对受检异常和非受检异常的理解
奇安信更新招股书：第一季亏损过5亿，齐向东持股38%
艾瑞咨询：2020年中国后智能厨房案例研究报告
艾瑞咨询：2020年中国人工智能+物流发展研究报告

章节导航