结论:不难,但步骤多、易踩坑。
只要熟悉 Linux 基础,照着步骤做,一般 1–2 次就能配好。
HDFS 本身不难,但 CentOS + Hadoop + HDFS 涉及的点比较多:
所以“难”不是原理难,而是 配置项琐碎。
以 单节点 / 伪分布式 为例,核心就这些:
java -version
没有就装:
yum install -y java-1.8.0-openjdk
wget https://downloads.apache.org/hadoop/common/hadoop-3.x.x/hadoop-3.x.x.tar.gz
tar -zxvf hadoop-3.x.x.tar.gz
~/.bashrc
export HADOOP_HOME=/opt/hadoop
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin
core-site.xml<configuration>
<property>
<name>fs.defaultFS</name>
<value>hdfs://localhost:9000</value>
</property>
</configuration>
hdfs-site.xml<configuration>
<property>
<name>dfs.replication</name>
<value>1</value>
</property>
</configuration>
ssh-keygen -t rsa
cat ~/.ssh/id_rsa.pub >> ~/.ssh/authorized_keys
chmod 600 ~/.ssh/authorized_keys
hdfs namenode -format
start-dfs.sh
验证:
jps
看到 NameNode、DataNode 就成功了。
| 问题 | 原因 |
|---|---|
| 启动失败 | JAVA_HOME 没配 |
| DataNode 起不来 | 多次格式化 NameNode |
| 节点间不通 | 防火墙 / SELinux |
| 权限拒绝 | 没用对的用户 |
| 场景 | 难度 |
|---|---|
| 单机 HDFS | ⭐⭐ |
| 伪分布式 | ⭐⭐⭐ |
| 3 节点集群 | ⭐⭐⭐⭐ |
| 生产高可用 | ⭐⭐⭐⭐⭐ |
✅ 第一次用:先跑 伪分布式
✅ 用 CentOS 7/8,别用太新
✅ 少用 root,新建 hadoop 用户
✅ 一步步来,不要一次改太多
如果你愿意,我可以:
你现在用的是 CentOS 几?单机还是集群?