温馨提示×

Debian怎么安装Hadoop

小樊
44
2026-08-28 20:17:19
栏目: 智能运维

在 Debian 系统上安装 Hadoop,一般可以按 “单机模式 → 伪分布式模式 → 完全分布式模式” 的顺序来。下面我先给你一个 最常用、最稳妥的“伪分布式安装方案”(适合学习/开发),如果你后面需要 完全分布式集群,我也可以再补充。


一、环境准备(Debian)

1️⃣ 系统要求

  • Debian 10 / 11 / 12(64 位)
  • 至少 4GB 内存(推荐 8GB)
  • 已配置 sudo
  • 能上网

2️⃣ 安装 JDK(Hadoop 必须)

Hadoop 3.x 推荐 Java 8 / 11

sudo apt update
sudo apt install openjdk-11-jdk -y

验证:

java -version

二、创建 Hadoop 专用用户(推荐)

sudo adduser hadoop
sudo usermod -aG sudo hadoop
su - hadoop

后面操作建议都在 hadoop 用户下进行


三、下载并安装 Hadoop

1️⃣ 下载 Hadoop

去官网:https://hadoop.apache.org/releases.html
例如(示例版本):

wget https://downloads.apache.org/hadoop/common/hadoop-3.3.6/hadoop-3.3.6.tar.gz

2️⃣ 解压并移动到 /opt

tar -xzf hadoop-3.3.6.tar.gz
sudo mv hadoop-3.3.6 /opt/hadoop
sudo chown -R hadoop:hadoop /opt/hadoop

四、配置环境变量

编辑 ~/.bashrc

nano ~/.bashrc

添加:

export HADOOP_HOME=/opt/hadoop
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin
export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64

生效:

source ~/.bashrc

验证:

hadoop version

五、配置 SSH(伪分布式必须)

1️⃣ 安装 SSH

sudo apt install ssh -y

2️⃣ 允许本机免密登录

ssh-keygen -t rsa -P "" -f ~/.ssh/id_rsa
cat ~/.ssh/id_rsa.pub >> ~/.ssh/authorized_keys
chmod 600 ~/.ssh/authorized_keys

测试:

ssh localhost

六、Hadoop 伪分布式配置(重点)

1️⃣ hadoop-env.sh

nano $HADOOP_HOME/etc/hadoop/hadoop-env.sh

添加或修改:

export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64

2️⃣ core-site.xml

nano $HADOOP_HOME/etc/hadoop/core-site.xml
<configuration>
  <property>
    <name>fs.defaultFS</name>
    <value>hdfs://localhost:9000</value>
  </property>
</configuration>

3️⃣ hdfs-site.xml

nano $HADOOP_HOME/etc/hadoop/hdfs-site.xml
<configuration>
  <property>
    <name>dfs.replication</name>
    <value>1</value>
  </property>
</configuration>

4️⃣ mapred-site.xml

nano $HADOOP_HOME/etc/hadoop/mapred-site.xml
<configuration>
  <property>
    <name>mapreduce.framework.name</name>
    <value>yarn</value>
  </property>
</configuration>

5️⃣ yarn-site.xml

nano $HADOOP_HOME/etc/hadoop/yarn-site.xml
<configuration>
  <property>
    <name>yarn.nodemanager.aux-services</name>
    <value>mapreduce_shuffle</value>
  </property>
</configuration>

七、格式化 HDFS(只需一次)

hdfs namenode -format

八、启动 Hadoop

start-dfs.sh
start-yarn.sh

检查进程:

jps

应看到:

  • NameNode
  • DataNode
  • SecondaryNameNode
  • ResourceManager
  • NodeManager

九、验证

1️⃣ HDFS Web UI

http://localhost:9870

2️⃣ YARN Web UI

http://localhost:8088

十、简单测试

hdfs dfs -mkdir /input
hdfs dfs -put $HADOOP_HOME/etc/hadoop/*.xml /input
hadoop jar $HADOOP_HOME/share/hadoop/mapreduce/hadoop-mapreduce-examples-*.jar wordcount /input /output
hdfs dfs -cat /output/part-r-00000

常见坑(Debian 特有)

✅ 如果报 JAVA_HOME not set
→ 检查 hadoop-env.sh~/.bashrc

✅ 如果 SSH 登录失败
→ 检查 .ssh 权限

✅ Debian 防火墙一般默认关闭,不用管


下一步你可以选择

✅ 完全分布式集群(3 台 Debian)
✅ HA(高可用)Hadoop
✅ Hive / HBase / Spark 整合
✅ Docker 方式安装 Hadoop

如果你愿意,我可以 一步一步带你搭一个 3 节点 Hadoop 集群,或者给你 Docker Compose 一键方案

0