下面给你一份在 Linux 上配置 Hadoop 环境的实用指南,适用于 Hadoop 单机 / 伪分布式(最常用学习环境)。如果你要的是完全分布式集群,我也可以单独补充。
Hadoop 依赖 Java。
java -version
如果没有 Java:
sudo apt update
sudo apt install openjdk-8-jdk -y # Ubuntu/Debian
# 或
sudo yum install java-1.8.0-openjdk-devel -y # CentOS
配置 JAVA_HOME:
echo 'export JAVA_HOME=/usr/lib/jvm/java-8-openjdk-amd64' >> ~/.bashrc
echo 'export PATH=$JAVA_HOME/bin:$PATH' >> ~/.bashrc
source ~/.bashrc
sudo useradd -m hadoop -s /bin/bash
sudo passwd hadoop
后续操作可在 hadoop 用户下完成。
wget https://downloads.apache.org/hadoop/common/hadoop-3.3.6/hadoop-3.3.6.tar.gz
tar -xzf hadoop-3.3.6.tar.gz
sudo mv hadoop-3.3.6 /usr/local/hadoop
配置环境变量:
echo 'export HADOOP_HOME=/usr/local/hadoop' >> ~/.bashrc
echo 'export PATH=$HADOOP_HOME/bin:$HADOOP_HOME/sbin:$PATH' >> ~/.bashrc
source ~/.bashrc
hadoop-env.shvim $HADOOP_HOME/etc/hadoop/hadoop-env.sh
添加:
export JAVA_HOME=/usr/lib/jvm/java-8-openjdk-amd64
core-site.xmlvim $HADOOP_HOME/etc/hadoop/core-site.xml
<configuration>
<property>
<name>fs.defaultFS</name>
<value>hdfs://localhost:9000</value>
</property>
</configuration>
hdfs-site.xmlvim $HADOOP_HOME/etc/hadoop/hdfs-site.xml
<configuration>
<property>
<name>dfs.replication</name>
<value>1</value>
</property>
</configuration>
mapred-site.xmlcp $HADOOP_HOME/etc/hadoop/mapred-site.xml.template \
$HADOOP_HOME/etc/hadoop/mapred-site.xml
vim $HADOOP_HOME/etc/hadoop/mapred-site.xml
<configuration>
<property>
<name>mapreduce.framework.name</name>
<value>yarn</value>
</property>
</configuration>
yarn-site.xmlvim $HADOOP_HOME/etc/hadoop/yarn-site.xml
<configuration>
<property>
<name>yarn.nodemanager.aux-services</name>
<value>mapreduce_shuffle</value>
</property>
</configuration>
ssh-keygen -t rsa
cat ~/.ssh/id_rsa.pub >> ~/.ssh/authorized_keys
chmod 600 ~/.ssh/authorized_keys
ssh localhost
hdfs namenode -format
start-dfs.sh
start-yarn.sh
jps
应看到:
Web 页面:
http://localhost:9870http://localhost:8088hdfs dfs -mkdir /test
hdfs dfs -put ~/.bashrc /test
hdfs dfs -ls /test
stop-yarn.sh
stop-dfs.sh
如果你需要:
直接告诉我你的 Linux 发行版和使用场景即可。