温馨提示×

debian集群跑hadoop怎弄

小樊
47
2026-09-05 15:02:15
栏目: 智能运维

Debian 集群上搭建 Hadoop 一般分几个阶段:系统准备 → 安装 Java → 配置 SSH 免密 → 安装 Hadoop → 配置集群 → 启动验证。下面给你一个实用、可落地的教程(以 Hadoop 3.x + Debian 11/12 为例)。


一、集群规划(示例)

假设 3 台 Debian 机器:

主机名 IP 角色
master 192.168.1.10 NameNode / ResourceManager
slave1 192.168.1.11 DataNode / NodeManager
slave2 192.168.1.12 DataNode / NodeManager

所有节点都要做前面“基础配置”


二、所有节点基础配置

1. 修改主机名

hostnamectl set-hostname master
# slave1 / slave2 同理

2. 配置 hosts

vim /etc/hosts

添加:

192.168.1.10 master
192.168.1.11 slave1
192.168.1.12 slave2

3. 安装 JDK

apt update
apt install openjdk-11-jdk -y

验证:

java -version

4. 创建 Hadoop 用户(推荐)

useradd -m hadoop
passwd hadoop

5. 配置 SSH 免密

master 上:

su - hadoop
ssh-keygen -t rsa
ssh-copy-id hadoop@slave1
ssh-copy-id hadoop@slave2

三、安装 Hadoop(所有节点)

wget https://downloads.apache.org/hadoop/common/hadoop-3.3.6/hadoop-3.3.6.tar.gz
tar -xzf hadoop-3.3.6.tar.gz -C /opt
mv /opt/hadoop-3.3.6 /opt/hadoop
chown -R hadoop:hadoop /opt/hadoop

配置环境变量

vim ~/.bashrc

添加:

export HADOOP_HOME=/opt/hadoop
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin
export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64
source ~/.bashrc

四、Hadoop 集群配置(master 上)

进入配置目录:

cd $HADOOP_HOME/etc/hadoop

1. core-site.xml

<configuration>
  <property>
    <name>fs.defaultFS</name>
    <value>hdfs://master:9000</value>
  </property>
</configuration>

2. hdfs-site.xml

<configuration>
  <property>
    <name>dfs.replication</name>
    <value>2</value>
  </property>
  <property>
    <name>dfs.namenode.name.dir</name>
    <value>/opt/hadoop/data/namenode</value>
  </property>
  <property>
    <name>dfs.datanode.data.dir</name>
    <value>/opt/hadoop/data/datanode</value>
  </property>
</configuration>

3. mapred-site.xml

<configuration>
  <property>
    <name>mapreduce.framework.name</name>
    <value>yarn</value>
  </property>
</configuration>

4. yarn-site.xml

<configuration>
  <property>
    <name>yarn.resourcemanager.hostname</name>
    <value>master</value>
  </property>
  <property>
    <name>yarn.nodemanager.aux-services</name>
    <value>mapreduce_shuffle</value>
  </property>
</configuration>

5. workers(旧版 slaves)

vim workers

内容:

slave1
slave2

五、同步配置到其他节点

scp -r /opt/hadoop slave1:/opt/
scp -r /opt/hadoop slave2:/opt/

六、启动 Hadoop

1. 格式化 NameNode(仅一次)

hdfs namenode -format

2. 启动 HDFS

start-dfs.sh

3. 启动 YARN

start-yarn.sh

七、验证

查看进程

jps
  • master:NameNode、ResourceManager
  • slave:DataNode、NodeManager

Web 界面

  • HDFS:http://master:9870
  • YARN:http://master:8088

八、常见坑

✅ 防火墙

ufw disable

✅ 时间同步(重要)

apt install ntp -y

✅ 目录权限

chown -R hadoop:hadoop /opt/hadoop

如果你愿意,我可以:

  • 给你 一键部署脚本
  • 帮你配 HA(高可用)
  • 或按你 物理机 / 虚拟机 / 云服务器 场景细化

你现在是几台机器?Debian 哪个版本?

0