从零开始学习Hadoop大数据(一)

📅 2026/7/22 10:08:12 👁️ 阅读次数 📝 编程学习
从零开始学习Hadoop大数据(一)

文章目录

  • 前言
  • 一、Hadoop是什么?
  • 二、Hadoop在大数据时代的地位与转型
  • 三、组件介绍
  • 基于CentOS-7搭建虚拟集群
  • 五、初步配置Xshell
  • 总结

正文:

前言

在大数据时代,处理海量数据已成为企业和研究机构面临的重要挑战。Hadoop作为Apache基金会旗下的开源分布式计算框架,已成为大数据处理领域的事实标准。本系列文章将带领您从零开始,系统学习Hadoop的核心知识与实践应用。

一、Hadoop是什么?

Hadoop是一个开源的分布式计算框架,主要用于存储和处理大规模数据集。它由Apache软件基金会开发,其设计灵感来源于Google的MapReduce和Google File System论文。Hadoop的核心优势在于高可靠性、高扩展性和高容错性,能够在廉价的硬件集群上稳定运行。如今,Hadoop已发展成为大数据生态系统的基石。

Hadoop的主要特点包括:

  • 高可靠性:数据自动在多个节点间复制,防止数据丢失
  • 高扩展性:可以轻松扩展到数千个节点
  • 高容错性:能够自动处理节点故障
  • 低成本:可以在普通硬件上运行

二、Hadoop在大数据时代的地位与转型

Hadoop 是“大数据”时代的核心驱动力之一,它让企业用廉价的硬件搭建大规模数据处理平台成为可能。包括雅虎、Facebook、百度、淘宝等众多公司都曾是早期重要的使用者或贡献者。

虽然如今的大数据领域也涌现了像Spark(基于内存计算,速度更快)这样更年轻的竞争者,但 Hadoop 的HDFSYARN依然作为很多现代大数据平台的基础设施,扮演着“数据底座”的角色。许多企业,尤其是数据体量极大、以离线批处理为核心需求的场景,仍然依赖着 Hadoop 生态。学习和理解 Hadoop,依然是理解当代大数据处理架构的一条重要路径。

三、组件介绍

三大组件:

1. HDFS(分布式文件系统)

HDFS(Hadoop Distributed File System)是Hadoop的存储组件,它将大文件分割成多个块(默认128MB),并将这些块分布存储在集群的不同节点上。

HDFS的主要功能定位是数据存储,拥有高容错、高吞吐,适合存储超大文件。

2. MapReduce(分布式计算框架)

MapReduce是Hadoop的计算框架,采用"分而治之"的思想,将计算任务分为Map和Reduce两个阶段。MapReduce的主要功能是数据处理,将大任务拆分为小任务并行计算,处理

3. YARN(资源管理器)

YARN(Yet Another Resource Negotiator)是Hadoop 2.0引入的资源管理框架,负责集群资源的管理和作业调度。

YARN的主要组件:

  • ResourceManager:全局资源管理器
  • NodeManager:每个节点上的资源管理器
  • ApplicationMaster:每个应用程序的管理器
  • Container:资源分配的基本单位

其他组件:

1.Hive:数据仓库,将 SQL 语句转换为 MapReduce 任务执行,降低开发门槛。
2.HBase:NoSQL 数据库,基于 HDFS 的分布式列式数据库,支持对海量数据进行实时、随机的读写访问。
3.ZooKeeper:协调服务,解决分布式环境下的数据管理问题,如配置维护、集群管理、分布式同步等。
4.Sqoop:数据迁移,用于在 Hadoop(HDFS/Hive) 和关系型数据库(如 MySQL)之间高效传输数据。
5.Flume:日志采集,一个高可用的日志收集、聚合和传输系统,擅长处理源源不断的流式数据。

基于CentOS-7搭建虚拟集群

要说明的是CentOS现在已经停更,小编只是用来学习使用。

1. 首先建立三至五台虚机机(小编使用的是VMware Workstation Pro 17.0)作为一个集群,虚拟机集群使用镜像“CentOS-7-x86_64-DVD-1511.iso”搭建虚机机,并进行初始化操作:

在输入vi /etc/sysconfig/network-scripts/ifcfg-eno16777736进入编辑界面后,按i进入编辑模式,将ONBOOT 的参数改为YES后,ESC退出编辑,输入“:wq”保存。

五、初步配置Xshell

1. 然后查看虚拟机的网络地址,通过地址连接Xshell,可以在Xshell中查看自己对应的版本号。(接下来的指令皆在Xshell中完成,所以不再赘述。)

接下来进入hosts文件编辑:

在文件末尾添加集群虚拟机的IP地址:

保存后用ping指令进行验证,最好两两之间都要相互ping一下进行验证:

如果输出结果一直有传输,代表没有问题。没问题后可以打开Windows里System32/drivers/etc/host文件,将虚拟机地址写到文件末尾,在控制面板中尝试连接本地与虚拟机。

2. 在linux系统中,防火墙是默认开启的,但防火墙有时会影响我们的连接,操作,所以要将防火墙关闭:

输入firewall-cmd --state后显示not running则成功关闭,注意要使用指令systemctl disable firewalld配合使用,不然每次重新开机后防火墙都会重新启动。


总结

Hadoop作为Apache基金会旗下的开源分布式系统基础架构,其核心设计源于Google的GFS与MapReduce思想,主要通过HDFS、MapReduce和YARN三大组件解决海量数据的存储与计算问题,实现了“化整为零、并行处理”的目标。

在大数据时代,尽管内存计算引擎Spark等新技术的涌现对Hadoop MapReduce形成了挑战,但HDFS和YARN凭借其高容错与高吞吐特性,依然是众多现代大数据平台不可或缺的“数据底座”,尤其在离线批处理场景中地位稳固。报告后续基于CentOS-7系统完成了虚拟集群的搭建,并初步配置了Xshell以实现远程连接管理,为后续深入进行大数据组件部署与实战操作奠定了基础。总而言之,理解Hadoop的架构思想是进入大数据领域的重要一步。