下面给你一份在 Debian 上搭建 Hadoop 集群(以 Hadoop 3.x 为例)的实战步骤,适合初学者到中等水平,从单机到多机集群都能用。
| 角色 | 主机名 | IP |
|---|---|---|
| NameNode + ResourceManager | master | 192.168.1.10 |
| DataNode + NodeManager | slave1 | 192.168.1.11 |
| DataNode + NodeManager | slave2 | 192.168.1.12 |
如果是学习,也可以 1 台机器伪分布式
# 更新系统
apt update && apt upgrade -y
# 设置主机名
hostnamectl set-hostname master # slave 上改成 slave1 / slave2
# 配置 hosts
vim /etc/hosts
192.168.1.10 master
192.168.1.11 slave1
192.168.1.12 slave2
useradd -m hadoop
passwd hadoop
后面都用 hadoop 用户操作。
Hadoop 依赖 JDK 8 或 11(推荐 JDK 8)
apt install openjdk-8-jdk -y
java -version
配置环境变量:
vim ~/.bashrc
export JAVA_HOME=/usr/lib/jvm/java-8-openjdk-amd64
export PATH=$PATH:$JAVA_HOME/bin
source ~/.bashrc
所有节点
apt install ssh -y
su - hadoop
ssh-keygen -t rsa
master 上
ssh-copy-id hadoop@slave1
ssh-copy-id hadoop@slave2
ssh-copy-id hadoop@master
测试:
ssh slave1
在 master 上操作:
wget https://downloads.apache.org/hadoop/common/hadoop-3.3.6/hadoop-3.3.6.tar.gz
tar -xzf hadoop-3.3.6.tar.gz -C /opt
mv /opt/hadoop-3.3.6 /opt/hadoop
环境变量:
vim ~/.bashrc
export HADOOP_HOME=/opt/hadoop
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin
source ~/.bashrc
进入配置目录:
cd $HADOOP_HOME/etc/hadoop
export JAVA_HOME=/usr/lib/jvm/java-8-openjdk-amd64
<configuration>
<property>
<name>fs.defaultFS</name>
<value>hdfs://master:9000</value>
</property>
<property>
<name>hadoop.tmp.dir</name>
<value>/opt/hadoop/tmp</value>
</property>
</configuration>
<configuration>
<property>
<name>dfs.replication</name>
<value>2</value>
</property>
<property>
<name>dfs.namenode.name.dir</name>
<value>/opt/hadoop/dfs/name</value>
</property>
<property>
<name>dfs.datanode.data.dir</name>
<value>/opt/hadoop/dfs/data</value>
</property>
</configuration>
<configuration>
<property>
<name>mapreduce.framework.name</name>
<value>yarn</value>
</property>
</configuration>
<configuration>
<property>
<name>yarn.resourcemanager.hostname</name>
<value>master</value>
</property>
<property>
<name>yarn.nodemanager.aux-services</name>
<value>mapreduce_shuffle</value>
</property>
</configuration>
vim workers
slave1
slave2
scp -r /opt/hadoop slave1:/opt/
scp -r /opt/hadoop slave2:/opt/
hdfs namenode -format
start-dfs.sh
start-yarn.sh
jps
master 应有:
slave 应有:
hdfs dfs -mkdir /test
hdfs dfs -put ~/.bashrc /test
hdfs dfs -ls /test
chown -R hadoop:hadoop /opt/hadoop
ufw disable
~/.ssh/authorized_keysPermitRootLogin如果你愿意,我可以:
✅ 给你 一键部署脚本
✅ 帮你 docker 化 Hadoop
✅ 专门讲 生产级集群配置
你现在是 学习 / 实验 / 生产 用?