温馨提示×

debian下hadoop怎么配

小樊
40
2026-09-02 11:43:05
栏目: 智能运维

下面给你一份Debian 下 Hadoop(以单机/伪分布式为例)的配置教程,适用于 Debian 11/12,Hadoop 3.x。


一、环境准备

1. 安装 JDK

Hadoop 依赖 Java:

sudo apt update
sudo apt install openjdk-11-jdk -y

验证:

java -version

2. 创建 Hadoop 用户(可选但推荐)

sudo adduser hadoop
sudo usermod -aG sudo hadoop
su - hadoop

3. 配置 SSH 免密登录

Hadoop 需要通过 SSH 启动进程:

sudo apt install ssh
ssh-keygen -t rsa -P "" -f ~/.ssh/id_rsa
cat ~/.ssh/id_rsa.pub >> ~/.ssh/authorized_keys
chmod 600 ~/.ssh/authorized_keys

测试:

ssh localhost

二、下载并安装 Hadoop

wget https://downloads.apache.org/hadoop/common/hadoop-3.3.6/hadoop-3.3.6.tar.gz
tar -xzf hadoop-3.3.6.tar.gz
sudo mv hadoop-3.3.6 /opt/hadoop

设置环境变量(~/.bashrc):

export HADOOP_HOME=/opt/hadoop
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin
export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64

生效:

source ~/.bashrc

三、Hadoop 基础配置(伪分布式)

1. 修改 hadoop-env.sh

nano $HADOOP_HOME/etc/hadoop/hadoop-env.sh

添加:

export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64

2. 配置 core-site.xml

nano $HADOOP_HOME/etc/hadoop/core-site.xml
<configuration>
  <property>
    <name>fs.defaultFS</name>
    <value>hdfs://localhost:9000</value>
  </property>
</configuration>

3. 配置 hdfs-site.xml

nano $HADOOP_HOME/etc/hadoop/hdfs-site.xml
<configuration>
  <property>
    <name>dfs.replication</name>
    <value>1</value>
  </property>
  <property>
    <name>dfs.namenode.name.dir</name>
    <value>file:/opt/hadoop/data/namenode</value>
  </property>
  <property>
    <name>dfs.datanode.data.dir</name>
    <value>file:/opt/hadoop/data/datanode</value>
  </property>
</configuration>

4. 配置 mapred-site.xml

cp $HADOOP_HOME/etc/hadoop/mapred-site.xml.template $HADOOP_HOME/etc/hadoop/mapred-site.xml
nano $HADOOP_HOME/etc/hadoop/mapred-site.xml
<configuration>
  <property>
    <name>mapreduce.framework.name</name>
    <value>yarn</value>
  </property>
</configuration>

5. 配置 yarn-site.xml

nano $HADOOP_HOME/etc/hadoop/yarn-site.xml
<configuration>
  <property>
    <name>yarn.nodemanager.aux-services</name>
    <value>mapreduce_shuffle</value>
  </property>
</configuration>

四、格式化并启动 Hadoop

1. 格式化 HDFS

hdfs namenode -format

2. 启动 Hadoop

start-dfs.sh
start-yarn.sh

查看进程:

jps

应看到:

  • NameNode
  • DataNode
  • ResourceManager
  • NodeManager

五、验证

浏览器访问:

  • HDFS: http://localhost:9870
  • YARN: http://localhost:8088

测试 HDFS:

hdfs dfs -mkdir /test
hdfs dfs -put $HADOOP_HOME/etc/hadoop/*.xml /test
hdfs dfs -ls /test

六、关闭 Hadoop

stop-yarn.sh
stop-dfs.sh

如果你需要:

  • Debian 多节点集群配置
  • Hadoop + Spark
  • systemd 服务化
  • 生产环境调优

告诉我你的使用场景,我可以给你更针对性的配置。

0