Hadoop 生态系统:从 HDFS 到 MapReduce 的大数据基础架构
一、Hadoop 的贡献
Hadoop 奠定了整个大数据生态的基础——在 Hadoop 之前处理大规模数据需要昂贵的专用硬件。Hadoop 的核心理念是用普通服务器集群分担计算和存储——成本大幅降低门槛大幅降低。即便今天 Spark 和 Flink 在计算效率上已经超越了 MapReduce——HDFS 分布式文件系统仍是很多数据平台的存储底座。
MapReduce 的编程模型虽然笨重但在历史上第一次让普通程序员可以处理 TB 甚至 PB 级的数据。
二、HDFS 的设计
HDFS 将大文件切分成若干数据块分散存储在集群的多台机器上——每个块默认有三副本保障数据安全。NameNode 管理元数据——文件到块的映射关系。
三、Hadoop 生态
Hive 提供 SQL 查询接口——分析师不需要会写 MapReduce 代码。HBase 是分布式的列式存储。
【交流与合作】微信号:abc6789122
内容由网络信息整理,仅供参考
← 返回火天使导航首页