一、Hadoop生态概述
Hadoop是Apache基金会的大数据框架,核心由HDFS分布式文件系统与MapReduce计算模型组成。HDFS提供高容错的分布式存储,MapReduce实现分布式计算。大数据时代,Hadoop奠定了海量数据处理的基础。
一)HDFS架构
HDFS采用主从架构,NameNode管理元数据,DataNode存储数据块。数据默认三副本冗余,保证高可用。文件块默认128MB,适合大文件存储。机架感知优化数据分布。
二)MapReduce原理
Map阶段并行处理输入数据,Shuffle阶段排序合并中间结果,Reduce阶段汇总输出。作业调度由ResourceManager负责。MapReduce适合离线批量处理,吞吐量高但延迟较大。
二、Hadoop应用实践
Hadoop集群部署需要规划硬件与网络,生态组件Hive、HBase、Spark等扩展能力。企业数据仓库构建常用Hive,实时查询用HBase,复杂计算用Spark。Hadoop学习路线从搭建集群开始,理解核心原理再深入组件。