Hadoop2源码分析－HDFS核心模块分析

日期：2022-05-29 栏目：程序人生浏览：次

　　这篇博客接着《Hadoop2源码分析－RPC机制初识》来讲述，前面我们对MapReduce、序列化、RPC进行了分析和探索，对Hadoop V2的这些模块都有了大致的了解，通过对这些模块的研究，我们明白了MapReduce的运行流程以及内部的实现机制，Hadoop的序列化以及它的通信机制（RPC）。今天我们来研究另一个核心的模块，那就是Hadoop的分布式文件存储系统——HDFS，下面是今天分享的内容目录：

HDFS简述

NameNode

DataNode

　　接下来，我们开始今天的分享内容。

2.HDFS简述

　　HDFS全称Hadoop Distributed File System，在HDFS中有几个基本的概念，首先是它的数据块（Block），HDFS的设计是用于支持大文件的。运行在HDFS上的程序也是用于处理大数据集的。这些程序仅写一次数据，一次或多次读数据请求，并且这些读操作要求满足流式传输速度。HDFS支持文件的一次写多次读操作。HDFS中典型的块大小是64MB，一个HDFS文件可以被被切分成多个64MB大小的块，如果需要，每一个块可以分布在不同的数据节点上。HDFS 中，如果一个文件小于一个数据块的大小，并不占用整个数据块存储空间。

　　HDFS提供了一个可操作文件系统的抽象类org.apache.hadoop.fs.FileSystem，该类被划分在Hadoop-Common部分，其源码地址为：hadoop-2.6.0-src/hadoop-common-project/hadoop-common/src/main/java/org/apache/hadoop/fs/FileSystem.java，如下是FileSystem的部分源码，如下所示：

@InterfaceAudience.Public @InterfaceStability.Stable public abstract class FileSystem extends Configured implements Closeable { // 代码内容省略 // ... }

转载注明出处：https://www.heiqu.com/zzfxyz.html

Hadoop2源码分析－HDFS核心模块分析

相关推荐