在 Linux 上配置 HDFS(Hadoop Distributed File System),通常是指安装并配置 Hadoop 的 HDFS 组件。下面按常见且实用的顺序,给你一个从零到可用的 HDFS 配置步骤(以 Hadoop 3.x 为例,适用于单机伪分布式或集群)。
systemctl stop firewalld
systemctl disable firewalld
Hadoop 依赖 Java(推荐 JDK 8 或 11)
java -version
如未安装:
yum install -y java-1.8.0-openjdk-devel
配置 JAVA_HOME:
export JAVA_HOME=/usr/lib/jvm/java-1.8.0-openjdk
useradd hadoop
passwd hadoop
su - hadoop
wget https://downloads.apache.org/hadoop/common/hadoop-3.3.6/hadoop-3.3.6.tar.gz
tar -zxvf hadoop-3.3.6.tar.gz
mv hadoop-3.3.6 /usr/local/hadoop
编辑 ~/.bashrc 或 /etc/profile:
export HADOOP_HOME=/usr/local/hadoop
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin
export HADOOP_CONF_DIR=$HADOOP_HOME/etc/hadoop
生效:
source ~/.bashrc
进入配置目录:
cd $HADOOP_HOME/etc/hadoop
hadoop-env.shexport JAVA_HOME=/usr/lib/jvm/java-1.8.0-openjdk
core-site.xml<configuration>
<property>
<name>fs.defaultFS</name>
<value>hdfs://localhost:9000</value>
</property>
</configuration>
集群环境:
localhost改为 NameNode 主机名或 IP
hdfs-site.xml<configuration>
<property>
<name>dfs.replication</name>
<value>1</value>
</property>
<property>
<name>dfs.namenode.name.dir</name>
<value>/data/hadoop/namenode</value>
</property>
<property>
<name>dfs.datanode.data.dir</name>
<value>/data/hadoop/datanode</value>
</property>
</configuration>
创建目录:
mkdir -p /data/hadoop/namenode
mkdir -p /data/hadoop/datanode
workers(Hadoop 3.x)vim workers
内容:
localhost
集群时填写 DataNode 的主机名
Hadoop 通过 SSH 启动服务
ssh-keygen -t rsa
ssh-copy-id localhost
测试:
ssh localhost
⚠️ 只能执行一次(除非清空数据)
hdfs namenode -format
成功标志:
Storage directory ... has been successfully formatted
start-dfs.sh
检查进程:
jps
应看到:
http://<IP>:9870
hdfs dfs -ls /
hdfs dfs -mkdir /test
hdfs dfs -put file.txt /test
stop-dfs.sh
| 问题 | 原因 |
|---|---|
| NameNode 起不来 | 未格式化或目录权限错误 |
| DataNode 不启动 | 多次格式化导致 clusterID 不一致 |
| 无法访问 9870 | 防火墙未关闭 |
| SSH 失败 | 未配置免密 |
dfs.replication ≥ 3如果你需要:
可以直接告诉我你的使用场景。