在 Debian 上跑 Hadoop,一般走 “单机 / 伪分布式” 这条路最简单,也最常用。下面给你一个从零到能跑 WordCount 的完整流程(基于 Debian 11/12,Hadoop 3.x)。
sudo apt update
sudo apt upgrade -y
sudo apt install openjdk-11-jdk -y
验证:
java -version
sudo adduser hadoop
sudo usermod -aG sudo hadoop
su - hadoop
之后的操作都在 hadoop 用户下完成。
Hadoop 需要无密码 SSH 登录自己。
sudo apt install ssh -y
生成密钥:
ssh-keygen -t rsa -P "" -f ~/.ssh/id_rsa
cat ~/.ssh/id_rsa.pub >> ~/.ssh/authorized_keys
chmod 600 ~/.ssh/authorized_keys
测试:
ssh localhost
去官方镜像:
wget https://downloads.apache.org/hadoop/common/hadoop-3.3.6/hadoop-3.3.6.tar.gz
(版本可自行替换)
tar -xzvf hadoop-3.3.6.tar.gz
mv hadoop-3.3.6 ~/hadoop
编辑 ~/.bashrc:
nano ~/.bashrc
加入:
export HADOOP_HOME=~/hadoop
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin
export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64
生效:
source ~/.bashrc
测试:
hadoop version
进入配置目录:
cd $HADOOP_HOME/etc/hadoop
nano hadoop-env.sh
添加或修改:
export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64
<configuration>
<property>
<name>fs.defaultFS</name>
<value>hdfs://localhost:9000</value>
</property>
</configuration>
<configuration>
<property>
<name>dfs.replication</name>
<value>1</value>
</property>
</configuration>
<configuration>
<property>
<name>mapreduce.framework.name</name>
<value>yarn</value>
</property>
</configuration>
<configuration>
<property>
<name>yarn.nodemanager.aux-services</name>
<value>mapreduce_shuffle</value>
</property>
</configuration>
hdfs namenode -format
start-dfs.sh
start-yarn.sh
验证进程:
jps
应看到:
NameNode
DataNode
SecondaryNameNode
ResourceManager
NodeManager
hdfs dfs -mkdir /input
echo "hello hadoop hello debian" > test.txt
hdfs dfs -put test.txt /input
yarn jar $HADOOP_HOME/share/hadoop/mapreduce/hadoop-mapreduce-examples-3.3.6.jar wordcount /input /output
hdfs dfs -cat /output/part-r-00000
stop-yarn.sh
stop-dfs.sh
确认:
echo $JAVA_HOME
并在 hadoop-env.sh 中显式设置。
systemctl status ssh
如果你告诉我:
我可以给你更精简或更生产级的方案。