温馨提示×

怎样用debian搭hadoop集群

小樊
39
2026-09-14 15:47:34
栏目: 智能运维

下面给你一份在 Debian 上搭建 Hadoop 集群(多节点)的实用指南,以 Hadoop 3.x + Debian 11/12 为例,步骤清晰、可落地。


一、集群规划(示例)

假设 3 台 Debian 机器:

主机名 IP 角色
master 192.168.10.10 NameNode / ResourceManager
slave1 192.168.10.11 DataNode / NodeManager
slave2 192.168.10.12 DataNode / NodeManager

生产环境可扩展更多节点


二、系统基础准备(所有节点)

1. 修改主机名

hostnamectl set-hostname master
# slave 节点同理

2. 配置 hosts

vi /etc/hosts
192.168.10.10 master
192.168.10.11 slave1
192.168.10.12 slave2

3. 安装 JDK

apt update
apt install -y openjdk-11-jdk

验证:

java -version

4. 创建 hadoop 用户(推荐)

useradd -m hadoop
passwd hadoop

三、配置 SSH 免密登录(关键)

master 上:

su - hadoop
ssh-keygen -t rsa

分发公钥:

ssh-copy-id hadoop@slave1
ssh-copy-id hadoop@slave2

测试:

ssh slave1

四、下载并安装 Hadoop(所有节点)

wget https://archive.apache.org/dist/hadoop/common/hadoop-3.3.6/hadoop-3.3.6.tar.gz
tar -xzf hadoop-3.3.6.tar.gz -C /opt
mv /opt/hadoop-3.3.6 /opt/hadoop
chown -R hadoop:hadoop /opt/hadoop

五、配置环境变量

vi ~/.bashrc
export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64
export HADOOP_HOME=/opt/hadoop
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin

生效:

source ~/.bashrc

六、Hadoop 核心配置(master 节点)

进入配置目录:

cd $HADOOP_HOME/etc/hadoop

1. hadoop-env.sh

export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64

2. core-site.xml

<configuration>
  <property>
    <name>fs.defaultFS</name>
    <value>hdfs://master:9000</value>
  </property>
  <property>
    <name>hadoop.tmp.dir</name>
    <value>/opt/hadoop/tmp</value>
  </property>
</configuration>

3. hdfs-site.xml

<configuration>
  <property>
    <name>dfs.replication</name>
    <value>2</value>
  </property>
  <property>
    <name>dfs.namenode.name.dir</name>
    <value>/opt/hadoop/data/namenode</value>
  </property>
  <property>
    <name>dfs.datanode.data.dir</name>
    <value>/opt/hadoop/data/datanode</value>
  </property>
</configuration>

4. mapred-site.xml

<configuration>
  <property>
    <name>mapreduce.framework.name</name>
    <value>yarn</value>
  </property>
</configuration>

5. yarn-site.xml

<configuration>
  <property>
    <name>yarn.resourcemanager.hostname</name>
    <value>master</value>
  </property>
  <property>
    <name>yarn.nodemanager.aux-services</name>
    <value>mapreduce_shuffle</value>
  </property>
</configuration>

6. workers(Hadoop 3 用 workers)

vi workers
slave1
slave2

七、同步配置到 slave 节点

scp -r /opt/hadoop slave1:/opt/
scp -r /opt/hadoop slave2:/opt/

确保权限一致:

chown -R hadoop:hadoop /opt/hadoop

八、启动 Hadoop 集群

1. 格式化 NameNode(仅第一次)

hdfs namenode -format

2. 启动 HDFS

start-dfs.sh

3. 启动 YARN

start-yarn.sh

九、验证集群

查看进程

jps

master 应有:

  • NameNode
  • ResourceManager

slave 应有:

  • DataNode
  • NodeManager

Web 界面

  • HDFS: http://master:9870
  • YARN: http://master:8088

十、测试 Hadoop

hdfs dfs -mkdir /test
hdfs dfs -put ~/.bashrc /test
hdfs dfs -ls /test

十一、常见问题

1. DataNode 不启动

  • 检查 dfs.datanode.data.dir 权限
  • 删除 data 目录重新格式化

2. SSH 无法免密

  • 确认 .ssh 权限为 700
  • authorized_keys 为 600

3. Debian 防火墙

ufw disable
# 或开放端口

如果你需要:

  • 单机伪分布式
  • HA(高可用)
  • Kerberos 安全
  • Debian + Docker 部署

可以继续问我。

0