在 Linux 上配置 HDFS(Hadoop Distributed File System) 通常包括 安装 Hadoop、配置 HDFS 相关文件、启动 HDFS 服务 等步骤。下面以 单机伪分布式模式(Pseudo-Distributed Mode) 为例,说明完整流程(生产环境通常是完全分布式,但步骤类似)。
Hadoop 依赖 Java。
java -version
如果没有安装:
sudo yum install java-1.8.0-openjdk-devel # CentOS
sudo apt install openjdk-8-jdk # Ubuntu
配置 JAVA_HOME:
export JAVA_HOME=/usr/lib/jvm/java-1.8.0-openjdk
sudo useradd hadoop
sudo passwd hadoop
su - hadoop
wget https://downloads.apache.org/hadoop/common/hadoop-3.3.6/hadoop-3.3.6.tar.gz
tar -zxvf hadoop-3.3.6.tar.gz
mv hadoop-3.3.6 /usr/local/hadoop
编辑 ~/.bashrc 或 /etc/profile:
export HADOOP_HOME=/usr/local/hadoop
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin
export HADOOP_CONF_DIR=$HADOOP_HOME/etc/hadoop
生效:
source ~/.bashrc
Hadoop 需要通过 SSH 启动节点。
ssh-keygen -t rsa
cat ~/.ssh/id_rsa.pub >> ~/.ssh/authorized_keys
chmod 600 ~/.ssh/authorized_keys
测试:
ssh localhost
配置文件位于:
$HADOOP_HOME/etc/hadoop
hadoop-env.shexport JAVA_HOME=/usr/lib/jvm/java-1.8.0-openjdk
core-site.xml<configuration>
<property>
<name>fs.defaultFS</name>
<value>hdfs://localhost:9000</value>
</property>
</configuration>
hdfs-site.xml<configuration>
<property>
<name>dfs.replication</name>
<value>1</value>
</property>
<property>
<name>dfs.namenode.name.dir</name>
<value>/usr/local/hadoop/data/namenode</value>
</property>
<property>
<name>dfs.datanode.data.dir</name>
<value>/usr/local/hadoop/data/datanode</value>
</property>
</configuration>
创建目录:
mkdir -p /usr/local/hadoop/data/namenode
mkdir -p /usr/local/hadoop/data/datanode
workers(Hadoop 3.x)vi $HADOOP_HOME/etc/hadoop/workers
内容:
localhost
⚠️ 只能执行一次,否则数据会丢失
hdfs namenode -format
start-dfs.sh
查看进程:
jps
应看到:
浏览器访问:
http://localhost:9870
hdfs dfs -mkdir /test
hdfs dfs -put test.txt /test
hdfs dfs -ls /test
stop-dfs.sh
JAVA_HOME 未设置
hadoop-env.sh端口被占用
权限问题
hadoop 用户或 chmodSSH 失败
~/.ssh/authorized_keyscore-site.xml、hdfs-site.xml如果你需要 完全分布式 HDFS(多节点) 或 结合 YARN 的集群配置,可以告诉我,我可以给你一份完整生产级配置示例。