温馨提示×

HDFS在Linux怎么配

小樊
44
2026-08-25 01:57:22
栏目: 智能运维

下面给你一个在 Linux 上配置 HDFS(Hadoop 分布式文件系统)完整实操流程,适合单机伪分布式完全分布式两种常见场景。内容偏实战,一步一步来即可。


一、环境准备(必备)

1️⃣ 系统要求

  • Linux(CentOS 7/8、Rocky、Ubuntu 20.04+ 均可)
  • Java 8 或以上(Hadoop 3.x 推荐 Java 8 / 11)

2️⃣ 安装 Java

java -version

如果没装:

# CentOS / Rocky
yum install -y java-1.8.0-openjdk-devel

# Ubuntu
apt install -y openjdk-8-jdk

二、创建 Hadoop 用户(推荐)

useradd hadoop
passwd hadoop
su - hadoop

三、安装 Hadoop

1️⃣ 下载 Hadoop

cd /opt
wget https://downloads.apache.org/hadoop/common/hadoop-3.3.6/hadoop-3.3.6.tar.gz
tar -zxvf hadoop-3.3.6.tar.gz
mv hadoop-3.3.6 hadoop

2️⃣ 配置环境变量

编辑 ~/.bashrc

export HADOOP_HOME=/opt/hadoop
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin
export JAVA_HOME=/usr/lib/jvm/java-1.8.0-openjdk

生效:

source ~/.bashrc

四、配置 HDFS(重点)

Hadoop 的核心配置文件都在:

$HADOOP_HOME/etc/hadoop/

五、核心配置文件

1️⃣ hadoop-env.sh

export JAVA_HOME=/usr/lib/jvm/java-1.8.0-openjdk

2️⃣ core-site.xml

<configuration>
  <property>
    <name>fs.defaultFS</name>
    <value>hdfs://localhost:9000</value>
  </property>
</configuration>

完全分布式时 localhost 改为 NameNode 主机名


3️⃣ hdfs-site.xml(最关键)

✅ 单机伪分布式

<configuration>
  <property>
    <name>dfs.replication</name>
    <value>1</value>
  </property>
  <property>
    <name>dfs.namenode.name.dir</name>
    <value>/data/hadoop/namenode</value>
  </property>
  <property>
    <name>dfs.datanode.data.dir</name>
    <value>/data/hadoop/datanode</value>
  </property>
</configuration>

创建目录:

mkdir -p /data/hadoop/namenode
mkdir -p /data/hadoop/datanode

4️⃣ workers(旧版本叫 slaves)

vim $HADOOP_HOME/etc/hadoop/workers

内容:

localhost

完全分布式时写 DataNode 主机名


六、SSH 免密登录(必须)

ssh-keygen -t rsa
ssh-copy-id localhost

测试:

ssh localhost

七、格式化 HDFS(⚠ 只做一次)

hdfs namenode -format

成功标志:

Storage directory /data/hadoop/namenode has been successfully formatted

八、启动 HDFS

start-dfs.sh

查看进程:

jps

应看到:

  • NameNode
  • DataNode
  • SecondaryNameNode

九、验证 HDFS

1️⃣ Web UI

浏览器访问:

http://localhost:9870

2️⃣ HDFS 基本操作

hdfs dfs -mkdir /test
hdfs dfs -put file.txt /test
hdfs dfs -ls /test

十、常见问题排查

❌ NameNode 起不来

  • 检查 hdfs-site.xml
  • 删除并重新格式化(⚠ 会丢数据)
rm -rf /data/hadoop/*
hdfs namenode -format

❌ 端口被占用

netstat -tunlp | grep 9000

十一、完全分布式(一句话总结)

节点 角色
master NameNode + ResourceManager
slave1 DataNode
slave2 DataNode
  • core-site.xml 用主机名
  • workers 写 DataNode
  • 所有节点 Java / Hadoop 路径一致
  • 所有节点 SSH 免密

十二、我可以继续帮你

你可以直接告诉我:

  • 单机还是集群?
  • Hadoop 版本?
  • CentOS 还是 Ubuntu?
  • 报错截图或日志

我可以按你的环境给你定制一套配置

0