温馨提示×

怎么部署linux hadoop

小樊
48
2026-08-13 13:32:04
栏目: 智能运维

下面给你一个从零开始在 Linux 上部署 Hadoop(单机 / 伪分布式)的完整流程,适合学习、测试环境。如果你后面需要完全分布式集群,我也可以继续补充。


一、环境准备

1. 系统要求

  • Linux(推荐 CentOS 7/8、Rocky、Ubuntu 20.04+
  • Java 8 或 Java 11
  • 普通用户(不建议直接用 root)

2. 安装 Java

# CentOS / Rocky
sudo yum install -y java-1.8.0-openjdk java-1.8.0-openjdk-devel

# Ubuntu
sudo apt update
sudo apt install -y openjdk-8-jdk

验证:

java -version

二、创建 Hadoop 用户(可选但推荐)

sudo useradd -m hadoop
sudo passwd hadoop
su - hadoop

三、下载并安装 Hadoop

1. 下载 Hadoop

wget https://downloads.apache.org/hadoop/common/hadoop-3.3.6/hadoop-3.3.6.tar.gz

2. 解压并移动

tar -zxvf hadoop-3.3.6.tar.gz
mv hadoop-3.3.6 /usr/local/hadoop

四、配置环境变量

编辑 ~/.bashrc

export HADOOP_HOME=/usr/local/hadoop
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin
export JAVA_HOME=/usr/lib/jvm/java-1.8.0-openjdk

生效:

source ~/.bashrc

验证:

hadoop version

五、配置 Hadoop(伪分布式模式)

1. hadoop-env.sh

vim $HADOOP_HOME/etc/hadoop/hadoop-env.sh

设置:

export JAVA_HOME=/usr/lib/jvm/java-1.8.0-openjdk

2. core-site.xml

vim $HADOOP_HOME/etc/hadoop/core-site.xml
<configuration>
  <property>
    <name>fs.defaultFS</name>
    <value>hdfs://localhost:9000</value>
  </property>
</configuration>

3. hdfs-site.xml

vim $HADOOP_HOME/etc/hadoop/hdfs-site.xml
<configuration>
  <property>
    <name>dfs.replication</name>
    <value>1</value>
  </property>
</configuration>

4. mapred-site.xml

vim $HADOOP_HOME/etc/hadoop/mapred-site.xml
<configuration>
  <property>
    <name>mapreduce.framework.name</name>
    <value>yarn</value>
  </property>
</configuration>

5. yarn-site.xml

vim $HADOOP_HOME/etc/hadoop/yarn-site.xml
<configuration>
  <property>
    <name>yarn.nodemanager.aux-services</name>
    <value>mapreduce_shuffle</value>
  </property>
</configuration>

六、配置 SSH 免密登录

ssh-keygen -t rsa
cat ~/.ssh/id_rsa.pub >> ~/.ssh/authorized_keys
chmod 600 ~/.ssh/authorized_keys

测试:

ssh localhost

七、格式化 HDFS

⚠️ 只需执行一次

hdfs namenode -format

八、启动 Hadoop

start-dfs.sh
start-yarn.sh

查看进程:

jps

应看到:

  • NameNode
  • DataNode
  • SecondaryNameNode
  • ResourceManager
  • NodeManager

九、访问 Web UI

  • HDFS:http://服务器IP:9870
  • YARN:http://服务器IP:8088

十、测试 Hadoop

hdfs dfs -mkdir /test
hdfs dfs -put $HADOOP_HOME/etc/hadoop/*.xml /test
hdfs dfs -ls /test

十一、常见问题

1. JAVA_HOME 报错

✅ 确保 hadoop-env.shyarn-env.sh 都配置了 JAVA_HOME

2. 端口无法访问

systemctl stop firewalld

或放行端口:

firewall-cmd --add-port=9870/tcp --permanent
firewall-cmd --reload

十二、下一步你可以做什么?

  • 部署 完全分布式 Hadoop 集群
  • 配置 高可用 HA
  • 安装 Hive / HBase / Spark
  • 使用 Docker / Kubernetes 部署 Hadoop

如果你告诉我:

  • Linux 版本
  • 单机还是多机
  • Hadoop 版本

我可以给你定制部署方案

0