下面给你一个**在 CentOS 上部署 HDFS 集群(伪分布式 / 完全分布式)**的实用步骤说明,适合新手到生产前环境。
| 角色 | 主机名 | IP |
|---|---|---|
| NameNode | nn1 | 192.168.1.10 |
| DataNode | dn1 | 192.168.1.11 |
| DataNode | dn2 | 192.168.1.12 |
如果是单机伪分布式,一台机器即可。
# 关闭防火墙
systemctl stop firewalld
systemctl disable firewalld
# 关闭 SELinux
setenforce 0
sed -i 's/SELINUX=enforcing/SELINUX=disabled/' /etc/selinux/config
# 配置 hosts
cat >> /etc/hosts <<EOF
192.168.1.10 nn1
192.168.1.11 dn1
192.168.1.12 dn2
EOF
# 安装 Java
yum install -y java-1.8.0-openjdk-devel
java -version
useradd hadoop
passwd hadoop
su - hadoop
ssh-keygen -t rsa
ssh-copy-id nn1
ssh-copy-id dn1
ssh-copy-id dn2
wget https://archive.apache.org/dist/hadoop/common/hadoop-3.3.6/hadoop-3.3.6.tar.gz
tar -zxvf hadoop-3.3.6.tar.gz -C /opt
ln -s /opt/hadoop-3.3.6 /opt/hadoop
配置环境变量:
cat >> ~/.bashrc <<EOF
export HADOOP_HOME=/opt/hadoop
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin
EOF
source ~/.bashrc
路径:$HADOOP_HOME/etc/hadoop/
<configuration>
<property>
<name>fs.defaultFS</name>
<value>hdfs://nn1:9000</value>
</property>
<property>
<name>hadoop.tmp.dir</name>
<value>/opt/hadoop/tmp</value>
</property>
</configuration>
<configuration>
<property>
<name>dfs.replication</name>
<value>2</value>
</property>
<property>
<name>dfs.namenode.name.dir</name>
<value>/opt/hadoop/dfs/name</value>
</property>
<property>
<name>dfs.datanode.data.dir</name>
<value>/opt/hadoop/dfs/data</value>
</property>
</configuration>
dn1
dn2
export JAVA_HOME=/usr/lib/jvm/java-1.8.0
export HDFS_NAMENODE_USER=hadoop
export HDFS_DATANODE_USER=hadoop
export HDFS_SECONDARYNAMENODE_USER=hadoop
hdfs namenode -format
start-dfs.sh
jps
NameNode 上应有:
DataNode 上应有:
Web UI:
http://nn1:9870
hdfs dfs -mkdir /test
hdfs dfs -put /etc/hosts /test
hdfs dfs -ls /test
确保目录属主是 hadoop:
chown -R hadoop:hadoop /opt/hadoop
/etc/hosts删除 dfs/name 和 dfs/data 后重新格式化
如果你需要:
可以直接告诉我。