在 Linux 环境下,Hadoop 的节点管理主要通过 HDFS(存储) 和 YARN(计算) 两大组件来完成。下面从架构、常用命令、配置方式、运维管理几个方面系统地说明。
| 角色 | 作用 |
|---|---|
| NameNode | 管理文件系统元数据(主节点) |
| DataNode | 存储实际数据块(从节点) |
| SecondaryNameNode | 定期合并元数据(非热备) |
| 角色 | 作用 |
|---|---|
| ResourceManager | 资源调度主节点 |
| NodeManager | 单节点资源管理 |
Hadoop 通过以下文件管理节点列表:
$HADOOP_HOME/etc/hadoop/workers
示例:
node1
node2
node3
旧版本叫
slaves
YARN 默认复用 workers 文件中的节点启动 NodeManager。
启动/停止命令:
start-dfs.sh
stop-dfs.sh
start-yarn.sh
stop-yarn.sh
hdfs dfsadmin -report
$HADOOP_HOME/etc/hadoop/hdfs-site.xml
<property>
<name>dfs.hosts.exclude</name>
<value>/opt/hadoop/etc/hadoop/excludes</value>
</property>
excludes 文件中加入节点:node3
hdfs dfsadmin -refreshNodes
Decommissioned 后再停节点。excludes 删除hadoop-daemon.sh start datanode
yarn node -list
yarn rmadmin -refreshNodes
配合:
<property>
<name>yarn.resourcemanager.nodes.exclude-path</name>
<value>/opt/hadoop/etc/hadoop/yarn-excludes</value>
</property>
jps
常见进程:
$HADOOP_HOME/logs/
hadoop-*-namenode-*.loghadoop-*-datanode-*.logdfs.datanode.data.dir
yarn.nodemanager.local-dirs
✅ 使用 Hadoop HA
✅ 使用 SSH 免密 管理节点
✅ 定期 fsck 检查:
hdfs fsck /
✅ 监控(Ganglia / Prometheus / Ambari)
如果你需要:
可以告诉我你的集群规模和用途。