温馨提示×

怎样在Debian配Hadoop

小樊
43
2026-09-20 19:36:28
栏目: 智能运维

下面给你一份**在 Debian 上配置 Hadoop(单节点 / 伪分布式)**的实用步骤。以 Debian 11/12 + Hadoop 3.x 为例,适合学习和测试环境。


一、准备工作

1. 更新系统

sudo apt update
sudo apt upgrade -y

2. 创建专用用户(推荐)

sudo adduser hadoop
sudo usermod -aG sudo hadoop
su - hadoop

二、安装 Java

Hadoop 依赖 Java(推荐 OpenJDK 8 或 11)

sudo apt install openjdk-11-jdk -y
java -version

记下 Java 路径(通常):

/usr/lib/jvm/java-11-openjdk-amd64

三、下载并安装 Hadoop

wget https://downloads.apache.org/hadoop/common/hadoop-3.3.6/hadoop-3.3.6.tar.gz
tar -xzf hadoop-3.3.6.tar.gz
sudo mv hadoop-3.3.6 /opt/hadoop
sudo chown -R hadoop:hadoop /opt/hadoop

四、配置环境变量

编辑 ~/.bashrc:

nano ~/.bashrc

添加:

export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64
export HADOOP_HOME=/opt/hadoop
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin

执行:

source ~/.bashrc

验证:

hadoop version

五、SSH 免密登录(必须)

sudo apt install ssh
ssh-keygen -t rsa -P "" -f ~/.ssh/id_rsa
cat ~/.ssh/id_rsa.pub >> ~/.ssh/authorized_keys
chmod 600 ~/.ssh/authorized_keys

测试:

ssh localhost

六、Hadoop 伪分布式配置

1. core-site.xml

nano $HADOOP_HOME/etc/hadoop/core-site.xml
<configuration>
  <property>
    <name>fs.defaultFS</name>
    <value>hdfs://localhost:9000</value>
  </property>
</configuration>

2. hdfs-site.xml

nano $HADOOP_HOME/etc/hadoop/hdfs-site.xml
<configuration>
  <property>
    <name>dfs.replication</name>
    <value>1</value>
  </property>
  <property>
    <name>dfs.namenode.name.dir</name>
    <value>file:/opt/hadoop/data/namenode</value>
  </property>
  <property>
    <name>dfs.datanode.data.dir</name>
    <value>file:/opt/hadoop/data/datanode</value>
  </property>
</configuration>

创建目录:

mkdir -p /opt/hadoop/data/namenode
mkdir -p /opt/hadoop/data/datanode

3. mapred-site.xml

nano $HADOOP_HOME/etc/hadoop/mapred-site.xml
<configuration>
  <property>
    <name>mapreduce.framework.name</name>
    <value>yarn</value>
  </property>
</configuration>

4. yarn-site.xml

nano $HADOOP_HOME/etc/hadoop/yarn-site.xml
<configuration>
  <property>
    <name>yarn.nodemanager.aux-services</name>
    <value>mapreduce_shuffle</value>
  </property>
</configuration>

七、格式化并启动

1. 格式化 HDFS

hdfs namenode -format

2. 启动 Hadoop

start-dfs.sh
start-yarn.sh

3. 查看进程

jps

应看到:

  • NameNode
  • DataNode
  • ResourceManager
  • NodeManager

八、验证

浏览器访问:

  • HDFS: http://localhost:9870
  • YARN: http://localhost:8088

测试命令:

hdfs dfs -mkdir /test
hdfs dfs -put ~/.bashrc /test
hdfs dfs -ls /test

九、关闭 Hadoop

stop-yarn.sh
stop-dfs.sh

十、常见问题

❌ Permission denied (publickey)

→ SSH 没配置好,重新做免密登录

❌ JAVA_HOME not set

→ 检查 .bashrc 和 hadoop-env.sh

❌ Debian 防火墙

sudo ufw disable

如果你需要:

  • Debian 多节点集群
  • Hadoop + Spark
  • 生产环境优化

可以继续问我。

0 踩