下面按最常见的 Hadoop HDFS 多节点(集群)配置来说明,适用于 Linux 环境。如果你只是想做伪分布式(单节点),我也可以单独给你一份简化版。
Hadoop 依赖 Java:
java -version
建议 JDK 8 或 11。
useradd hadoop
passwd hadoop
假设有 3 台机器:
| 节点类型 | 主机名 | IP |
|---|---|---|
| NameNode | master | 192.168.1.10 |
| DataNode | slave1 | 192.168.1.11 |
| DataNode | slave2 | 192.168.1.12 |
每台机器都配置:
vim /etc/hosts
192.168.1.10 master
192.168.1.11 slave1
192.168.1.12 slave2
NameNode 能免密登录所有 DataNode
在 master 执行:
ssh-keygen -t rsa
ssh-copy-id slave1
ssh-copy-id slave2
验证:
ssh slave1
tar -zxvf hadoop-3.x.x.tar.gz -C /usr/local/
mv /usr/local/hadoop-3.x.x /usr/local/hadoop
配置环境变量:
vim /etc/profile
export HADOOP_HOME=/usr/local/hadoop
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin
source /etc/profile
以下文件在:
$HADOOP_HOME/etc/hadoop/
<configuration>
<property>
<name>fs.defaultFS</name>
<value>hdfs://master:9000</value>
</property>
<property>
<name>hadoop.tmp.dir</name>
<value>/data/hadoop/tmp</value>
</property>
</configuration>
<configuration>
<property>
<name>dfs.namenode.name.dir</name>
<value>/data/hadoop/namenode</value>
</property>
<property>
<name>dfs.datanode.data.dir</name>
<value>/data/hadoop/datanode</value>
</property>
<property>
<name>dfs.replication</name>
<value>2</value>
</property>
<property>
<name>dfs.namenode.http-address</name>
<value>master:9870</value>
</property>
</configuration>
旧版本叫 slaves
vim $HADOOP_HOME/etc/hadoop/workers
slave1
slave2
export JAVA_HOME=/usr/lib/jvm/java-8-openjdk
scp -r /usr/local/hadoop slave1:/usr/local/
scp -r /usr/local/hadoop slave2:/usr/local/
hdfs namenode -format
⚠️ 只能执行一次,否则数据会丢
start-dfs.sh
jps
NameNodeDataNodeWeb UI:
http://master:9870
dfs.datanode.data.dir 权限systemctl stop firewalld
删除所有节点的:
/data/hadoop/dfs/
重新格式化
如果你是学习用单台 Linux:
workers 写 localhostdfs.replication=1如果你愿意,可以告诉我:
我可以直接给你一步一步可复制命令版。