Hadoop的入门学习(理论知识)
以下理论部分参考了网上的一些资料,安装部分自己实践心得(见下一篇)目录一、什么Hadoop二、核心组件1、Hadoop 分布式文件系统(HDFS)1.1、HDFS架构图1.2、HDFS执行步骤(写数据)1.3、HDFS执行步骤(读数据)1.4、Secondary NameNode工作原理2、MapReduce (分布式计算框架)2.1、MapReduce执行流程2.2、Map Task工作机制2.3、Reduce Task工作机制3、YARN(资源调度管理框架)3.1、YARN基本框架3.2、RARN的角色3.2.1、ResourceManager (RM) —— 部门经理3.2.2、 NodeManager (NM) —— 组长3.2.3、ApplicationMaster (AM) —— 项目经理3.2.4、 Container —— 项目资源3.3、YARN工作机制4、Hadoop的优势一、什么HadoopHadoop是一个由Apache基金会所开发的用于解决海量数据的存储及分析计算问题的分布式系统基础架构。简单地说来,Hadoop是一个可以更容易开发和运行处理大规模数据的软件平台 。网上大都是这么说的:狭义上来说 ,hadoop就是单独指代hadoop这个软件广义上来说 ,hadoop指代大数据的一个生态圈,包含很多其他软件以下是hadoop生态圈中的技术:二、核心组件狭义上的Hadoop是指其核心的四个组件主要由HDFS、MapReduce、Yarn组成、Common模块。HDFS:分布式文件系统MapReduce:分布式计算系统Yarn:分布式集群资源管理Common模块1、Hadoop 分布式文件系统(HDFS)Hadoop 的核心组件之一是HDFS(Hadoop Distributed File System)是一个分布式文件系统,用于存储文件,通过目录树来定位文件。可以将大型数据集存储在多台机器上。它的设计思想是将数据分成多个块,并将它们分别存储在不同的机器上,以提高可靠性和效率。HDFS 主要由 NameNode 和 DataNode 两部分组成。NameNode(nn):NN是一个中心服务器,负责管理文件系统的命名空间(namespace)以及客户端对文件的访问,其中存储了文件的元数据,包括文件名、文件目录结构、文件属性(生成时间、副本数、权限)等,以及每个文件的块列表和列表中的块与块所在的DataNode之间的地址映射关系;所有的文件系统操作,如读、写、删除等都由NameNode控制。NN的容错机制非常重要,因为如果运行NN的机器坏掉的话,系统中的文件将会完全丢失。Hadoop提供了两种机制:1)将持久化存储在本地硬盘的文件系统元数据备份;2)运行一个辅助的NN(SecondaryNameNode),定期将namespace镜像文件(fsimage)与操作日志文件(edit log)合并。DataNode(dn):一般是一个节点一个;负责管理它所在节点上的存储,真正用于在本地文件系统存放数据,并向 NameNode 报告存储信息;以及块数据的校验和;执行数据块的读写操作;DataNode 会定期向 NameNode 发送心跳信号,以确保数据块的完整性和可用性。DN的基本单位是块(block),默认128M。在HDFS上会保存数据的副本,默认是3个,即同一块数据会同时存储在3个不同的DN上进行备份Secondary NameNode(2nn):定期备份NameNode元数据;在紧急情况下,可辅助恢复NameNode。1.1、HDFS架构图1.2、HDFS执行步骤(写数据)1.3、HDFS执行步骤(读数据)

相关新闻

最新新闻

日新闻

周新闻

月新闻