Hadoop 生态系统全景:从 HDFS 到 YARN 的分布式基础架构
一、Hadoop 是大数据时代的奠基石
当 Google 在 2003 和 2004 年相继发表 GFS 和 MapReduce 论文时,工业界还没有廉价处理 PB 级数据的手段。Doug Cutting 受这两篇论文启发创建了 Hadoop,从此"用普通 PC 服务器搭建分布式计算集群"从不可能变成了标配。十五年后,Hadoop 的 HDFS 和 YARN 依然是绝大多数大数据平台的底座。
二、三大核心组件
一)HDFS——数据不丢的基石
HDFS 的设计哲学是"写一次,读多次"。文件被切分为 128MB 的 Block,每个 Block 默认三副本分布在不同节点上。NameNode 维护元数据和目录树,DataNode 存储实际数据块。这种架构的代价是 NameNode 成为单点——虽然后续的 HDFS HA 通过 JournalNode 实现了热备,但小文件过多时 NameNode 内存压力仍是大数据集群的头号杀手。
二)MapReduce——经典计算模型
MapReduce 虽然不再是一线分析工具,但它的编程模型——Map 和 Reduce——深刻影响了后续所有分布式计算框架。理解 MapReduce 的 Shuffle 阶段是理解所有大数据框架性能优化的钥匙。
三)YARN——资源调度的指挥官
YARN 将资源管理和任务调度解耦,让 Hadoop 从一个只能跑 MapReduce 的专用平台变成了可以同时运行 Spark、Flink、Hive 等多种计算引擎的通用平台。ResourceManager 负责全局资源分配,每个应用的 ApplicationMaster 负责该应用内部的任务调度和容错。
三、Hadoop 在 2025 年的定位
Hadoop 已经从"大数据唯一解决方案"变成了"基础设施底座"。越来越多的企业采用"存算分离"架构——数据存在 HDFS 或 OSS/S3 上,计算交给 Spark 或 Presto。Hadoop 不会再是热门话题,但它在数据基础设施中的地位就像水电一样不可或缺。