下面给出在 Linux 上配置 HDFS(Hadoop 分布式文件系统)的典型完整流程,适用于单机伪分布式和完全分布式两种常见场景。内容基于 Hadoop 3.x(2.x 也基本一致)。
# CentOS
systemctl stop firewalld
systemctl disable firewalld
Hadoop 依赖 JDK(推荐 JDK 8 或 11)
java -version
如未安装:
yum install -y java-1.8.0-openjdk java-1.8.0-openjdk-devel
设置环境变量:
export JAVA_HOME=/usr/lib/jvm/java-1.8.0-openjdk
useradd hadoop
passwd hadoop
su - hadoop
wget https://downloads.apache.org/hadoop/common/hadoop-3.3.6/hadoop-3.3.6.tar.gz
tar -zxvf hadoop-3.3.6.tar.gz
mv hadoop-3.3.6 /usr/local/hadoop
编辑 ~/.bashrc 或 /etc/profile:
export HADOOP_HOME=/usr/local/hadoop
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin
export HADOOP_CONF_DIR=$HADOOP_HOME/etc/hadoop
生效:
source ~/.bashrc
Hadoop 依赖 SSH 启动进程。
ssh-keygen -t rsa
cat ~/.ssh/id_rsa.pub >> ~/.ssh/authorized_keys
chmod 600 ~/.ssh/authorized_keys
测试:
ssh localhost
所有配置文件位于:
$HADOOP_HOME/etc/hadoop
export JAVA_HOME=/usr/lib/jvm/java-1.8.0-openjdk
<configuration>
<property>
<name>fs.defaultFS</name>
<value>hdfs://localhost:9000</value>
</property>
</configuration>
若是完全分布式,将
localhost改为 NameNode 主机名
<configuration>
<property>
<name>dfs.replication</name>
<value>1</value>
</property>
<property>
<name>dfs.namenode.name.dir</name>
<value>/data/hadoop/namenode</value>
</property>
<property>
<name>dfs.datanode.data.dir</name>
<value>/data/hadoop/datanode</value>
</property>
</configuration>
创建目录:
mkdir -p /data/hadoop/namenode
mkdir -p /data/hadoop/datanode
localhost
完全分布式时填写 DataNode 主机名
⚠️ 只在第一次部署时执行
hdfs namenode -format
成功标志:
Storage directory ... has been successfully formatted
start-dfs.sh
检查进程:
jps
应包含:
http://localhost:9870
hdfs dfs -mkdir /test
hdfs dfs -put test.txt /test
hdfs dfs -ls /test
在 多台机器 时:
core-site.xmlhdfs-site.xmldfs.namenode.name.dirdfs.datanode.data.dirworkers 文件中填写所有 DataNode 主机名hdfs namenode -format
start-dfs.sh
JAVA_HOME$HADOOP_HOME/logs
dfs.datanode.data.dir 权限不足如果你需要:
可以直接告诉我你的 Linux 版本和使用场景。