温馨提示×

debian Hadoop集群怎搭

小樊
41
2026-09-17 16:39:03
栏目: 智能运维

下面给你一份在 Debian 上搭建 Hadoop 集群(以 Hadoop 3.x 为例)的实战步骤,适合初学者到中等水平,从单机到多机集群都能用。


一、环境准备

1. 机器规划(示例)

角色 主机名 IP
NameNode + ResourceManager master 192.168.1.10
DataNode + NodeManager slave1 192.168.1.11
DataNode + NodeManager slave2 192.168.1.12

如果是学习,也可以 1 台机器伪分布式


2. 基础系统设置(所有节点)

# 更新系统
apt update && apt upgrade -y

# 设置主机名
hostnamectl set-hostname master   # slave 上改成 slave1 / slave2

# 配置 hosts
vim /etc/hosts
192.168.1.10 master
192.168.1.11 slave1
192.168.1.12 slave2

3. 创建用户(推荐)

useradd -m hadoop
passwd hadoop

后面都用 hadoop 用户操作。


二、安装 Java

Hadoop 依赖 JDK 8 或 11(推荐 JDK 8)

apt install openjdk-8-jdk -y
java -version

配置环境变量:

vim ~/.bashrc
export JAVA_HOME=/usr/lib/jvm/java-8-openjdk-amd64
export PATH=$PATH:$JAVA_HOME/bin
source ~/.bashrc

三、配置 SSH 免密登录(重点)

所有节点

apt install ssh -y
su - hadoop
ssh-keygen -t rsa

master 上

ssh-copy-id hadoop@slave1
ssh-copy-id hadoop@slave2
ssh-copy-id hadoop@master

测试:

ssh slave1

四、安装 Hadoop

master 上操作:

wget https://downloads.apache.org/hadoop/common/hadoop-3.3.6/hadoop-3.3.6.tar.gz
tar -xzf hadoop-3.3.6.tar.gz -C /opt
mv /opt/hadoop-3.3.6 /opt/hadoop

环境变量:

vim ~/.bashrc
export HADOOP_HOME=/opt/hadoop
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin
source ~/.bashrc

五、Hadoop 核心配置

进入配置目录:

cd $HADOOP_HOME/etc/hadoop

1. hadoop-env.sh

export JAVA_HOME=/usr/lib/jvm/java-8-openjdk-amd64

2. core-site.xml

<configuration>
  <property>
    <name>fs.defaultFS</name>
    <value>hdfs://master:9000</value>
  </property>
  <property>
    <name>hadoop.tmp.dir</name>
    <value>/opt/hadoop/tmp</value>
  </property>
</configuration>

3. hdfs-site.xml

<configuration>
  <property>
    <name>dfs.replication</name>
    <value>2</value>
  </property>
  <property>
    <name>dfs.namenode.name.dir</name>
    <value>/opt/hadoop/dfs/name</value>
  </property>
  <property>
    <name>dfs.datanode.data.dir</name>
    <value>/opt/hadoop/dfs/data</value>
  </property>
</configuration>

4. mapred-site.xml

<configuration>
  <property>
    <name>mapreduce.framework.name</name>
    <value>yarn</value>
  </property>
</configuration>

5. yarn-site.xml

<configuration>
  <property>
    <name>yarn.resourcemanager.hostname</name>
    <value>master</value>
  </property>
  <property>
    <name>yarn.nodemanager.aux-services</name>
    <value>mapreduce_shuffle</value>
  </property>
</configuration>

6. workers(Hadoop 3 用 workers)

vim workers
slave1
slave2

六、分发 Hadoop 到从节点

scp -r /opt/hadoop slave1:/opt/
scp -r /opt/hadoop slave2:/opt/

七、启动 Hadoop 集群

1. 格式化 NameNode(仅第一次)

hdfs namenode -format

2. 启动 HDFS

start-dfs.sh

3. 启动 YARN

start-yarn.sh

4. 查看进程

jps

master 应有:

  • NameNode
  • ResourceManager

slave 应有:

  • DataNode
  • NodeManager

八、Web 界面

  • HDFS: http://master:9870
  • YARN: http://master:8088

九、测试 Hadoop

hdfs dfs -mkdir /test
hdfs dfs -put ~/.bashrc /test
hdfs dfs -ls /test

十、常见问题

1. 权限问题

chown -R hadoop:hadoop /opt/hadoop

2. 防火墙

ufw disable

3. SSH 连不上

  • 检查 ~/.ssh/authorized_keys
  • 检查 PermitRootLogin

十一、你可以继续学什么

  • HA(高可用)
  • ZooKeeper
  • Hive / Spark on Hadoop
  • 安全(Kerberos)

如果你愿意,我可以: ✅ 给你 一键部署脚本
✅ 帮你 docker 化 Hadoop
✅ 专门讲 生产级集群配置

你现在是 学习 / 实验 / 生产 用?

0