61 Hadoop Hadoop学习路线图
2015-06-30 01:03
281 查看
按照这个路线图来学习即可。
1、M. Tim Jones的三篇文章:
用Hadoop进行分布式数据处理第1部分(入门):http://www.ibm.com/developerworks/cn/linux/l-hadoop-1/index.html
用Hadoop进行分布式数据处理第2部分(进阶):http://www.ibm.com/developerworks/cn/linux/l-hadoop-2/index.html
用Hadoop进行分布式数据处理第3部分(应用程序开发):http://www.ibm.com/developerworks/cn/linux/l-hadoop-3/index.html
2、“银河里的星星”的博客,其中的Google论文系列(就包括开创性论文“MapReduce:简化大集群上的数据处理”)、搜索与分布式方面的介绍
[google论文三]MapReduce简化大集群上的数据处理:http://duanple.blog.163.com/blog/static/709717672010923203501/
词频统计的Map/Reduce程序可以从这里找到:/article/8187725.html
Google论文系列:http://duanple.blog.163.com/blog/#m=0&t=3&c=google
按照Hadoop各组件来串联:http://duanple.blog.163.com/blog/static/7097176720119791920962/
3、IBM developerWorks上的其他Hadoop文章,在dw上用Hadoop关键字进行搜索,可以找到大量Hadoop的文章
下面一些需要看:
Hadoop Distributed File System简介:http://www.ibm.com/developerworks/cn/web/wa-introhdfs/index.html
使用Apache Pig处理数据:http://www.ibm.com/developerworks/cn/bigdata/basic.html
4、《开源软件架构》中的介绍
(卷1第8章)HDFS--Hadoop分布式文件系统:http://www.ituring.com.cn/article/4299
英文原文:http://www.aosabook.org/en/index.html (其中的卷1第8章)
5、阿里集团数据平台的官方博客,包含大量Hadoop研究和应用经验
http://www.alidata.org/archives
6、百度搜索研发部的官方博客,主要包含分布式系统(Hadoop)、搜索技术、数据挖掘、大型网站架构等方面的经验
http://baidu-tech.com/
7、董的博客,关于Hadoop、分布式系统的研究
http://dongxicheng.org/recommend/
8、官方文档当然更不能少了,主要包括Hadoop集群的搭建,MapReduce的使用,HDFS架构方面的介绍
优先看稳定版:http://hadoop.apache.org/docs/stable/
最新版(包括下一代MapReduce即YARN的介绍):http://hadoop.apache.org/docs/current/
9、caibinbupt的博客,Hadoop源代码分析系列
http://caibinbupt.iteye.com/?page=6
千与的专栏,Hadoop-0.20.0源码分析
http://blog.csdn.net/shirdrn/article/category/595039/3
10、spork的博客,其中关于Hadoop的系列
http://www.cnblogs.com/spork/category/226077.html
11、chinacloud的博客,其中的Hadoop架构、分布式系统设计方面的一些经验
/article/6581631.html
12、beanmoon的博客,其中的Hadoop系列
http://www.cnblogs.com/beanmoon/
1、M. Tim Jones的三篇文章:
用Hadoop进行分布式数据处理第1部分(入门):http://www.ibm.com/developerworks/cn/linux/l-hadoop-1/index.html
用Hadoop进行分布式数据处理第2部分(进阶):http://www.ibm.com/developerworks/cn/linux/l-hadoop-2/index.html
用Hadoop进行分布式数据处理第3部分(应用程序开发):http://www.ibm.com/developerworks/cn/linux/l-hadoop-3/index.html
2、“银河里的星星”的博客,其中的Google论文系列(就包括开创性论文“MapReduce:简化大集群上的数据处理”)、搜索与分布式方面的介绍
[google论文三]MapReduce简化大集群上的数据处理:http://duanple.blog.163.com/blog/static/709717672010923203501/
词频统计的Map/Reduce程序可以从这里找到:/article/8187725.html
Google论文系列:http://duanple.blog.163.com/blog/#m=0&t=3&c=google
按照Hadoop各组件来串联:http://duanple.blog.163.com/blog/static/7097176720119791920962/
3、IBM developerWorks上的其他Hadoop文章,在dw上用Hadoop关键字进行搜索,可以找到大量Hadoop的文章
下面一些需要看:
Hadoop Distributed File System简介:http://www.ibm.com/developerworks/cn/web/wa-introhdfs/index.html
使用Apache Pig处理数据:http://www.ibm.com/developerworks/cn/bigdata/basic.html
4、《开源软件架构》中的介绍
(卷1第8章)HDFS--Hadoop分布式文件系统:http://www.ituring.com.cn/article/4299
英文原文:http://www.aosabook.org/en/index.html (其中的卷1第8章)
5、阿里集团数据平台的官方博客,包含大量Hadoop研究和应用经验
http://www.alidata.org/archives
6、百度搜索研发部的官方博客,主要包含分布式系统(Hadoop)、搜索技术、数据挖掘、大型网站架构等方面的经验
http://baidu-tech.com/
7、董的博客,关于Hadoop、分布式系统的研究
http://dongxicheng.org/recommend/
8、官方文档当然更不能少了,主要包括Hadoop集群的搭建,MapReduce的使用,HDFS架构方面的介绍
优先看稳定版:http://hadoop.apache.org/docs/stable/
最新版(包括下一代MapReduce即YARN的介绍):http://hadoop.apache.org/docs/current/
9、caibinbupt的博客,Hadoop源代码分析系列
http://caibinbupt.iteye.com/?page=6
千与的专栏,Hadoop-0.20.0源码分析
http://blog.csdn.net/shirdrn/article/category/595039/3
10、spork的博客,其中关于Hadoop的系列
http://www.cnblogs.com/spork/category/226077.html
11、chinacloud的博客,其中的Hadoop架构、分布式系统设计方面的一些经验
/article/6581631.html
12、beanmoon的博客,其中的Hadoop系列
http://www.cnblogs.com/beanmoon/
相关文章推荐
- java架构解密——实时动态aop
- Kaggle Diabetic Retinopathy Detection 参赛攻略之一 问题分析
- openstack - 常用CLI命令
- 37条常用Shell命令
- Linux-命令-dig
- 如何在 Linux 上安装、配置 NTP 服务器和客户端?
- 在Linux系统下一键重新安装WordPress的脚本示例
- Linux 有问必答:在 Linux 上如何通过命令行来更改日期和时间
- 对伙伴算法的理解
- linux安装pdo_dblib扩展支持sqlserver
- Linux 下 配置JDK
- 天下数据详解Linux系统备份策略
- Hadoop2.3.0上部署Mahout0.10,并测试单机版与分布式版个性化推荐程序
- 关于System.getProperties和System.getenv的区别
- 邮件服务器搭建
- CentOS - 搭建yum源
- lishell学习之路:流程控制(case)
- Apache Maven 入门篇 ( 上 )
- 解决Tomcat: Can't load IA 32-bit .dll on a AMD 64-bit platform问题
- linux命令学习:iptables详解2