在 Linux 环境下启动 Hadoop 集群,通常分为 伪分布式(单节点) 和 完全分布式(多节点) 两种情况。下面按常见流程说明。
java -version
ssh-keygen -t rsa
ssh-copy-id hadoop@node1
ssh-copy-id hadoop@node2
常见配置文件(在 $HADOOP_HOME/etc/hadoop):
core-site.xmlhdfs-site.xmlmapred-site.xmlyarn-site.xmlworkers(或 slaves)示例(core-site.xml):
<configuration>
<property>
<name>fs.defaultFS</name>
<value>hdfs://node1:9000</value>
</property>
</configuration>
hdfs namenode -format
⚠️ 只能格式化一次,否则数据会丢失。
start-dfs.sh
start-yarn.sh
或(老版本):
start-all.sh
start-dfs.sh
start-yarn.sh
jps
常见进程:
stop-dfs.sh
stop-yarn.sh
或:
stop-all.sh
chown -R hadoop:hadoop /opt/hadoop
检查:
netstat -tunlp | grep 9000
/etc/hostsworkers 文件如果你告诉我:
我可以给你更精确的启动命令和配置示例。