“Debian 与 Hadoop 整合”通常是指在 Debian / Debian 系 Linux(如 Ubuntu)上安装、配置并运行 Hadoop 集群。下面我从 整体思路 → 安装方式 → 关键配置 → 常见问题 四个方面说明。
Debian 本身只是一个 Linux 发行版,Hadoop 是 Java 写的分布式计算框架,两者整合的本质是:
在 Debian 系统上提供 Java 环境 + SSH + Hadoop 软件 + 正确配置
典型架构:
sudo apt update
sudo apt upgrade -y
sudo apt install openjdk-11-jdk -y
java -version
sudo useradd -m hadoop
sudo passwd hadoop
su - hadoop
ssh-keygen -t rsa
ssh-copy-id localhost
ssh-copy-id slave1
ssh-copy-id slave2
wget https://archive.apache.org/dist/hadoop/common/hadoop-3.3.6/hadoop-3.3.6.tar.gz
tar -xzf hadoop-3.3.6.tar.gz
sudo mv hadoop-3.3.6 /opt/hadoop
配置环境变量:
export HADOOP_HOME=/opt/hadoop
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin
apt install hadoop
问题:
编辑 $HADOOP_HOME/etc/hadoop/
export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64
<configuration>
<property>
<name>fs.defaultFS</name>
<value>hdfs://master:9000</value>
</property>
</configuration>
<configuration>
<property>
<name>dfs.replication</name>
<value>3</value>
</property>
</configuration>
<configuration>
<property>
<name>mapreduce.framework.name</name>
<value>yarn</value>
</property>
</configuration>
<configuration>
<property>
<name>yarn.resourcemanager.hostname</name>
<value>master</value>
</property>
</configuration>
slave1
slave2
hdfs namenode -format
start-dfs.sh
start-yarn.sh
jps
应包含:
Web UI:
http://master:9870http://master:8088✅ 防火墙(如启用)
sudo ufw allow 9000
sudo ufw allow 8088
✅ 主机名解析
/etc/hosts
192.168.1.10 master
192.168.1.11 slave1
192.168.1.12 slave2
✅ 文件描述符限制(生产环境)
/etc/security/limits.conf
hadoop - nofile 65536
| 问题 | 原因 |
|---|---|
| SSH 无法免密 | 公钥未正确复制 |
| NameNode 起不来 | 未格式化或端口冲突 |
| DataNode 不注册 | hosts / firewall 问题 |
| Java 版本错误 | JAVA_HOME 配错 |
Debian + Hadoop 整合 = Debian 提供系统环境,Hadoop 以 Java 服务形式运行,通过 SSH + 配置文件形成集群。
如果你需要:
我可以给你 具体步骤或脚本。