下面分 Linux 下 Hadoop 环境配置(单机/伪分布式) 给你一个完整、实用、可复制的流程。如果你用的是 Ubuntu / CentOS / Rocky / Debian 都适用,只是包管理器略有不同。
Hadoop 依赖 Java。
java -version
# Ubuntu / Debian
sudo apt update
sudo apt install openjdk-8-jdk -y
# CentOS / Rocky
sudo yum install java-1.8.0-openjdk-devel -y
编辑:
sudo vim /etc/profile
添加:
export JAVA_HOME=/usr/lib/jvm/java-8-openjdk-amd64
export PATH=$JAVA_HOME/bin:$PATH
生效:
source /etc/profile
sudo useradd -m hadoop
sudo passwd hadoop
su - hadoop
ssh-keygen -t rsa
cat ~/.ssh/id_rsa.pub >> ~/.ssh/authorized_keys
chmod 600 ~/.ssh/authorized_keys
测试:
ssh localhost
能免密登录即可。
wget https://downloads.apache.org/hadoop/common/hadoop-3.3.6/hadoop-3.3.6.tar.gz
tar -zxvf hadoop-3.3.6.tar.gz
mv hadoop-3.3.6 ~/hadoop
编辑:
vim ~/.bashrc
添加:
export HADOOP_HOME=~/hadoop
export PATH=$HADOOP_HOME/bin:$HADOOP_HOME/sbin:$PATH
export HADOOP_CONF_DIR=$HADOOP_HOME/etc/hadoop
生效:
source ~/.bashrc
验证:
hadoop version
所有配置文件在:
$HADOOP_HOME/etc/hadoop/
vim $HADOOP_HOME/etc/hadoop/hadoop-env.sh
添加或修改:
export JAVA_HOME=/usr/lib/jvm/java-8-openjdk-amd64
<configuration>
<property>
<name>fs.defaultFS</name>
<value>hdfs://localhost:9000</value>
</property>
</configuration>
<configuration>
<property>
<name>dfs.replication</name>
<value>1</value>
</property>
</configuration>
<configuration>
<property>
<name>mapreduce.framework.name</name>
<value>yarn</value>
</property>
</configuration>
<configuration>
<property>
<name>yarn.nodemanager.aux-services</name>
<value>mapreduce_shuffle</value>
</property>
</configuration>
hdfs namenode -format
✅ 看到 successfully formatted 即可
start-dfs.sh
start-yarn.sh
查看进程:
jps
应看到:
NameNode
DataNode
SecondaryNameNode
ResourceManager
NodeManager
hdfs dfs -mkdir /test
hdfs dfs -ls /
stop-yarn.sh
stop-dfs.sh
echo $JAVA_HOME
确认 hadoop-env.sh 中已配置
netstat -tunlp | grep 9000
chmod 700 ~/.ssh
chmod 600 ~/.ssh/authorized_keys
✅ 完全分布式集群
✅ HA(高可用)
✅ Hive / HBase / Spark
✅ 生产环境参数调优
如果你愿意,可以告诉我:
我可以直接帮你 定制配置 ✅