温馨提示×

debian如何调hadoop

小樊
46
2026-09-02 11:51:04
栏目: 智能运维

在 Debian 上“调 Hadoop”一般分几种情况:

  • 安装并运行 Hadoop
  • 配置 Hadoop(单机 / 伪分布式 / 集群)
  • 调优 Hadoop 性能
  • 排查 Hadoop 问题

下面按最常见路径给你一份实用指南(以 Debian 11/12 + Hadoop 3.x 为例)。


一、Debian 上安装 Hadoop(伪分布式)

1. 安装基础依赖

sudo apt update
sudo apt install -y openjdk-11-jdk ssh pdsh
java -version

2. 创建 Hadoop 用户(推荐)

sudo adduser hadoop
sudo su - hadoop

3. 下载 Hadoop

wget https://downloads.apache.org/hadoop/common/hadoop-3.3.6/hadoop-3.3.6.tar.gz
tar -xzf hadoop-3.3.6.tar.gz
mv hadoop-3.3.6 hadoop

4. 配置环境变量

nano ~/.bashrc

添加:

export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64
export HADOOP_HOME=~/hadoop
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin
source ~/.bashrc

二、Hadoop 基本配置(伪分布式)

1. 配置 core-site.xml

nano $HADOOP_HOME/etc/hadoop/core-site.xml
<configuration>
  <property>
    <name>fs.defaultFS</name>
    <value>hdfs://localhost:9000</value>
  </property>
</configuration>

2. 配置 hdfs-site.xml

<configuration>
  <property>
    <name>dfs.replication</name>
    <value>1</value>
  </property>
</configuration>

3. 配置 mapred-site.xml

<configuration>
  <property>
    <name>mapreduce.framework.name</name>
    <value>yarn</value>
  </property>
</configuration>

4. 配置 yarn-site.xml

<configuration>
  <property>
    <name>yarn.nodemanager.aux-services</name>
    <value>mapreduce_shuffle</value>
  </property>
</configuration>

三、启动 Hadoop

1. 格式化 NameNode

hdfs namenode -format

2. 启动 HDFS 和 YARN

start-dfs.sh
start-yarn.sh

3. 查看进程

jps

应看到:

  • NameNode
  • DataNode
  • ResourceManager
  • NodeManager

四、Web 界面

  • HDFS: http://localhost:9870
  • YARN: http://localhost:8088

五、常见“调”的问题

1. SSH 无法免密

ssh-keygen -t rsa
cat ~/.ssh/id_rsa.pub >> ~/.ssh/authorized_keys
ssh localhost

2. 端口被占用

netstat -tunlp | grep 9000

3. 内存不足(Debian 小内存机器)

修改:

$HADOOP_HOME/etc/hadoop/yarn-site.xml
<property>
  <name>yarn.nodemanager.resource.memory-mb</name>
  <value>1024</value>
</property>

六、如果你说的是“调优 Hadoop”

可重点看:

  • yarn.scheduler.maximum-allocation-mb
  • mapreduce.map.memory.mb
  • dfs.blocksize
  • JVM GC 参数

如果你能说清楚:

“我是要装 Hadoop配集群、还是性能调优 / 排错?”

我可以直接给你对应方案(甚至帮你写 hadoop-env.sh 或 systemd 服务)。

0