AI导航网

技术频道

公众号推荐

微信公众号搜"智元新知"关注
微信扫一扫可直接关注哦！

hadoop入门(5)：了解hadoop

时间：2022-09-04分类：Hadoop作者：编程之家原文地址

hadoop的起源

阶段一
Hadoop最早起源于Nutch。Nutch的设计目标是构建一个大型的全网搜索引擎，包括网页抓取、索引、查询等功能，但随着抓取网页数量的增加，遇到了严重的可扩展性问题——如何解决数十亿网页的存储和索引问题。
阶段二
2003年、2004年谷歌发表的两篇论文为该问题提供了可行的解决方案。
——分布式文件系统（GFS），可用于处理海量网页的存储
——分布式计算框架MAPREDUCE，可用于处理海量网页的索引计算问题。
阶段三
Nutch的开发人员完成了相应的开源实现HDFS和MAPREDUCE，并从Nutch中剥离成为独立项目HADOOP，到2008年1月，HADOOP成为Apache顶级项目(同年，cloudera公司成立)，迎来了它的快速发展期。
狭义上来说，hadoop就是单独指代hadoop这个软件，
广义上来说，hadoop指代大数据的一个生态圈，包括很多其他的软件

hadoop的版本及选择

hadoop发展版本
- 0.x版本：hadoop较早的一个开源版本，在此基础上发展的1.x和2.x版本
- 1.x版本：hadoop的第二代开源版本，主要修复了0.x版本的一些bug
- 2.x版本：架构发生了重大变化，引入了yarn平台，也是现在生产环境中使用最多的版本
- 3.x版本：在2.x版本基础上引入了一些hdfs新性质，且已发展为稳定版本，未来公司使用趋势
hadoop发行版本
- Apache版本
  最基础的版本适合入门学习
- Cloudera版本
  大型互联网企业使用
- Hortonworks版本
  文档很不错
- ……

hadoop的运行模式

本地运行模式

无需任何守护进程，所有进程都在一个JVM上运行。在独立模式下调试MR程序的时候非常高效方便。所以一般该模式下一般是学习或开发阶段调试使用
伪分布式运行模式

hadoop的守护进程运行在本地机器上，模拟一个小规模的集群，换句话说可以配置一台机器的hadoop集群
伪分布式是完全分布式的一个特例
完全分布式运行模式（重点）

hadoop守护进程运行在一个集群上，需要多台机器来实现完全分布式服务的安装

hadoop的架构模块

hadoop由三个模块组成
- 分布式存储HDFS
- 分布式计算MapReduce
- 资源调度引擎YARN

关键词
- 分布式
- 主从架构

HDFS架构剖析

分块存储
- 在hadoop2.x中，保存文件到HDFS时，会默认按128M的单位将文件分割成一个个block块
- 数据以block块的形式存储在HDFS文件系统中
  - block块的大小可以在hdfs-site.xml中进行修改
  - hdfs-default.xml

<property>
  <name>dfs.blocksize</name>
  <value>块的大小，以字节为单位</value>  <!-- 只写数值即可 -->
</property>

副本存储
- 为了保存block块的安全性，也就是数据的安全性，在hadoop2.x中采用文件，默认保存三个副本，我们可以更改副本的数量来提高数据的安全性
  - 副本的数量可以在hdfs-site.xml中进行修改

<property>
  <name>dfs.replication</name>
  <value>3</value>  <!-- 默认为3 -->
</property>

抽象成块的好处
- 可以存放很大的文件
- 使用块抽象而不是文件，可以很好简化存储子系统
- 块非常适合数据备份，进而提供输入容错性和可用性
HDFS架构
- HDFS集群包括：NameNode、Datanode、Secondary NameNode
  - NameNode：负责管理整个系统的元数据，以及每一个路径（文件）所对应的数据块信息
  - Datanode：负责管理用户的文件数据块，每一个数据块都可以在多个datanode上存储多个副本
  - Secondary NameNode：用来监控HDFS系统状态的辅助后台程序，每隔一段时间获取HDFS元数据的快照。最主要的作用是辅助namenode管理元数据信息。

版权声明：本文内容由互联网用户自发贡献，该文观点与技术仅代表作者本人。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容，请发送邮件至 [email protected] 举报，一经查实，本站将立刻删除。

相关推荐

hadoop day2-搭建

hadoop搭建准备工作三台虚拟机：master、node1、node2检查时间是否同步：date检查java的jdk是否被安装好：java-version修改主机名三台分别执行vim/etc/hostname并将内容指定为对应的主机名关闭防火墙：systemctlst...

作者：编程之家时间：2022-11-24

Hadoop 二十三

文件的更名和移动: 获取文件详细信息遇到的问题：不能直接在web上上传文件。权限问题：修改后即可正常创建参考：https://blog.csdn.net/weixin_44575660/article/details/118687993

作者：编程之家时间：2022-11-24

大数据Hadoop之——HDFS小文件问题与处理实战操作

目录一、背景1）小文件是如何产生的？2）文件块大小设置3）HDFS分块目的二、HDFS小文件问题处理方案1）HadoopArchive（HAR）2）Sequencefile3）CombineFileInputFormat4）开启JVM重用5）合并本地的小文件，上传到HDF...

作者：编程之家时间：2022-10-19

大数据Hadoop之——Hadoop HDFS多目录磁盘扩展与数据平衡实战操作

目录一、概述二、HadoopDataNode多目录磁盘配置1）配置hdfs-site.xml2）配置详解1、dfs.datanode.data.dir2、dfs.datanode.fsdataset.volume.choosing.policy3、dfs.datanode.available-space-volume-choosing-polic...

作者：编程之家时间：2022-10-19

平台搭建伪分布式

平台搭建（伪分布式）伪分布式搭建在VM中搭建std-master修改配置文件centos7-cl1.vmdkstd-master.vmx-将配置文件中vm的版本号改成自己电脑对应的vm版本修改客户端的操作系统为centos764位打开虚拟机修改虚拟机网络cd...

作者：编程之家时间：2022-10-13

Harley浅谈HadoopHDFS

一、HDFS概述 1.1、HDFS产出背景及定义 1.1.1、HDFS产生背景随着数据量越来越大，在一个操作系统存不下所有的数据，那么就分配到更多的操作系统管理的磁盘中，但是不方便管理和维护，迫切需要一种系统来管...

作者：编程之家时间：2022-10-13

配置workers进入hadoop/etc/hadoop 编辑workers文件然后分发给另外两个服务器准备启动集群第一次需要初始化. 初始化完成后增加了data文件，进入上面那个路径，就能看到当前服务器的版本号 ...

作者：编程之家时间：2022-10-13

第六周总结8.13

这周我对ssm框架进行了更深一步的开发，加入了多用户，并对除登录外的请求进行了拦截，这样用户在未登录的时候是访问不到资源的。并且对hadoop进行了初步的学习，包括虚拟机的安装等等。下周会对hadoop进行更深一步的...

作者：编程之家时间：2022-10-13

安装Hadoop2.10.1

前言通过在Hadoop1安装Hadoop,然后配置相应的配置文件，最后将Hadoop所有文件同步到其他Hadoop节点。一、集群规划#主机名‘master/hadoop1’‘slave01/hadoop2’‘slave02/hadoop3’#启动节点NamenodeNodemanagerNod...

作者：编程之家时间：2022-10-13

集群崩溃处理

1.先杀死进程（先进入到hadoop版本文件里，我的是/opt/module/hadoop-3.1.3/）sbin/stop-dfs.sh2.删除每个集群上的data以及logsrm-rfdata/logs/3.格式化hdfsnamenode-format4.再启动sbin/sart-dfs.sh

作者：编程之家时间：2022-10-13