温馨提示×

如何使用linux hadoop脚本

小樊
40
2026-09-13 15:59:41
栏目: 智能运维

下面按**“从零开始、日常最常用”**的思路,系统讲一下 Linux 下 Hadoop 脚本的使用方法。以 Hadoop 3.x(最主流) 为例,命令路径以 $HADOOP_HOME/bin$HADOOP_HOME/sbin 为主。


一、环境准备(前提)

1. 配置环境变量(推荐)

export HADOOP_HOME=/opt/hadoop
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin

验证:

hadoop version

二、Hadoop 启动 / 停止脚本(sbin)

1. 启动 Hadoop(伪分布式 / 完全分布式)

start-dfs.sh        # 启动 HDFS
start-yarn.sh       # 启动 YARN

或一次启动全部:

start-all.sh

⚠️ start-all.sh 已不推荐,但依然可用


2. 停止 Hadoop

stop-dfs.sh
stop-yarn.sh

或:

stop-all.sh

3. 单独启动组件

hadoop-daemon.sh start namenode
hadoop-daemon.sh start datanode

yarn-daemon.sh start resourcemanager
yarn-daemon.sh start nodemanager

三、HDFS 常用脚本(bin/hadoop)

1. 查看 HDFS 状态

hdfs dfsadmin -report

2. 文件系统操作(最常用)

hadoop fs -ls /
hadoop fs -mkdir /test
hadoop fs -put file.txt /test/
hadoop fs -get /test/file.txt ./
hadoop fs -cat /test/file.txt
hadoop fs -rm /test/file.txt
hadoop fs -rm -r /test

✅ 推荐新写法(等价):

hdfs dfs -ls /

3. 安全模式

hdfs dfsadmin -safemode get
hdfs dfsadmin -safemode leave

四、MapReduce / YARN 脚本

1. 提交 MapReduce 作业

yarn jar wordcount.jar com.xxx.WordCount /input /output

2. 查看 YARN 任务

yarn application -list
yarn application -kill application_123456_0001

3. 查看日志

yarn logs -applicationId application_123456_0001

五、常用运维脚本

1. 格式化 NameNode(仅第一次)

hdfs namenode -format

⚠️ 会清空 HDFS 数据,慎用


2. 平衡数据

hdfs balancer

3. 检查块健康

hdfs fsck /

六、典型使用流程示例

# 1. 启动
start-dfs.sh
start-yarn.sh

# 2. 上传数据
hadoop fs -mkdir /input
hadoop fs -put data.txt /input

# 3. 提交任务
yarn jar mr.jar WordCount /input /output

# 4. 查看结果
hadoop fs -cat /output/part-r-00000

# 5. 停止
stop-yarn.sh
stop-dfs.sh

七、常见问题速查

问题 解决
command not found 检查 PATH / HADOOP_HOME
NameNode 不启动 查看 logs,是否未格式化
端口占用 检查 50070 / 8088
权限拒绝 使用 hdfs dfs -chmod

如果你愿意,我可以:

  • 给你 伪分布式搭建完整脚本
  • 生产集群(多节点)
  • 专门讲 Hadoop Shell 命令对照表

你现在是 学习 / 面试 / 生产环境 哪种场景?

0