温馨提示×

Debian怎么启动Hadoop

小樊
45
2026-07-18 17:15:57
栏目: 智能运维

在 Debian 上启动 Hadoop,通常分 单机(Local)伪分布式(Pseudo-Distributed)完全分布式 三种情况。下面给你一套最常见的伪分布式启动流程(适合学习/测试),并说明 Debian 上的注意事项。


一、前置条件(Debian 必须)

1. 安装 Java(Hadoop 依赖)

sudo apt update
sudo apt install openjdk-11-jdk -y

验证:

java -version

设置 JAVA_HOME(编辑 ~/.bashrc):

export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64
export PATH=$JAVA_HOME/bin:$PATH

生效:

source ~/.bashrc

2. 创建 Hadoop 用户(推荐)

sudo adduser hadoop
sudo usermod -aG sudo hadoop
su - hadoop

3. 配置 SSH 免密登录(Hadoop 必须)

sudo apt install openssh-server openssh-client -y
ssh-keygen -t rsa -P "" -f ~/.ssh/id_rsa
cat ~/.ssh/id_rsa.pub >> ~/.ssh/authorized_keys
chmod 600 ~/.ssh/authorized_keys

测试:

ssh localhost

二、安装 Hadoop

1. 下载 Hadoop(示例 3.3.6)

wget https://downloads.apache.org/hadoop/common/hadoop-3.3.6/hadoop-3.3.6.tar.gz
tar -xzf hadoop-3.3.6.tar.gz
mv hadoop-3.3.6 ~/hadoop

2. 配置 Hadoop 环境变量

编辑 ~/.bashrc

export HADOOP_HOME=~/hadoop
export PATH=$HADOOP_HOME/bin:$HADOOP_HOME/sbin:$PATH
export HADOOP_CONF_DIR=$HADOOP_HOME/etc/hadoop

生效:

source ~/.bashrc

三、修改 Hadoop 配置文件(伪分布式)

以下配置文件均在:

$HADOOP_HOME/etc/hadoop/

1. hadoop-env.sh

export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64

2. core-site.xml

<configuration>
  <property>
    <name>fs.defaultFS</name>
    <value>hdfs://localhost:9000</value>
  </property>
</configuration>

3. hdfs-site.xml

<configuration>
  <property>
    <name>dfs.replication</name>
    <value>1</value>
  </property>
  <property>
    <name>dfs.namenode.name.dir</name>
    <value>file:///home/hadoop/hadoop_data/namenode</value>
  </property>
  <property>
    <name>dfs.datanode.data.dir</name>
    <value>file:///home/hadoop/hadoop_data/datanode</value>
  </property>
</configuration>

创建目录:

mkdir -p ~/hadoop_data/namenode
mkdir -p ~/hadoop_data/datanode

4. mapred-site.xml

<configuration>
  <property>
    <name>mapreduce.framework.name</name>
    <value>yarn</value>
  </property>
</configuration>

5. yarn-site.xml

<configuration>
  <property>
    <name>yarn.nodemanager.aux-services</name>
    <value>mapreduce_shuffle</value>
  </property>
</configuration>

四、格式化 HDFS(只做一次)

hdfs namenode -format

⚠️ 不要重复执行


五、启动 Hadoop

1. 启动 HDFS

start-dfs.sh

2. 启动 YARN

start-yarn.sh

六、验证是否启动成功

jps

应看到类似:

NameNode
DataNode
SecondaryNameNode
ResourceManager
NodeManager

Web UI:

  • HDFS: http://localhost:9870
  • YARN: http://localhost:8088

七、停止 Hadoop

stop-yarn.sh
stop-dfs.sh

八、常见问题(Debian 常见)

1. ssh localhost 失败

sudo systemctl enable --now ssh

2. JAVA_HOME 不生效

确认:

echo $JAVA_HOME

3. 端口被占用

netstat -tunlp | grep 9000

九、如果你需要

  • 完全分布式(多节点)
  • Hadoop + Hive / Spark
  • Debian 服务器生产环境配置

告诉我你的使用场景,我可以直接给你定制方案

0