下面给你一个Linux 下搭建 HDFS 集群(Hadoop 分布式文件系统)的实用级步骤指南,以 Hadoop 3.x 为例,适合学习和生产入门。
假设 3 台机器:
| 主机名 | IP | 角色 |
|---|---|---|
| master | 192.168.1.10 | NameNode + ResourceManager |
| slave1 | 192.168.1.11 | DataNode |
| slave2 | 192.168.1.12 | DataNode |
实际生产可分离 NameNode / ResourceManager / DataNode
yum install java-1.8.0-openjdk-devel -y
# 或
apt install openjdk-8-jdk -y
验证:
java -version
useradd hadoop
passwd hadoop
hostnamectl set-hostname master
/etc/hosts:
192.168.1.10 master
192.168.1.11 slave1
192.168.1.12 slave2
在 master 上:
ssh-keygen -t rsa
ssh-copy-id master
ssh-copy-id slave1
ssh-copy-id slave2
测试:
ssh slave1
所有节点:
wget https://downloads.apache.org/hadoop/common/hadoop-3.3.6/hadoop-3.3.6.tar.gz
tar -xzf hadoop-3.3.6.tar.gz -C /opt
ln -s /opt/hadoop-3.3.6 /opt/hadoop
/etc/profile.d/hadoop.sh:
export HADOOP_HOME=/opt/hadoop
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin
export JAVA_HOME=/usr/lib/jvm/java-1.8.0
source /etc/profile
配置文件目录:
$HADOOP_HOME/etc/hadoop
core-site.xml<configuration>
<property>
<name>fs.defaultFS</name>
<value>hdfs://master:9000</value>
</property>
<property>
<name>hadoop.tmp.dir</name>
<value>/opt/hadoop/tmp</value>
</property>
</configuration>
hdfs-site.xml<configuration>
<property>
<name>dfs.replication</name>
<value>2</value>
</property>
<property>
<name>dfs.namenode.name.dir</name>
<value>/opt/hadoop/dfs/name</value>
</property>
<property>
<name>dfs.datanode.data.dir</name>
<value>/opt/hadoop/dfs/data</value>
</property>
</configuration>
workers(Hadoop 3)slave1
slave2
hadoop-env.shexport JAVA_HOME=/usr/lib/jvm/java-1.8.0
scp -r /opt/hadoop slave1:/opt
scp -r /opt/hadoop slave2:/opt
hdfs namenode -format
start-dfs.sh
jps
NameNodeDataNodeWeb UI:
http://master:9870
hdfs dfs -mkdir /test
hdfs dfs -put file.txt /test
hdfs dfs -ls /
workersdfs/data 重新格式化systemctl stop firewalld
如果你愿意,我可以:
你现在是 学习 / 测试 / 生产 环境?