备份 Debian 上的 Hadoop 通常涉及 配置文件、元数据(NameNode)、数据本身以及可能的 Hive/调度相关组件。下面按「最常用、最安全」的方式给你一个完整思路。
Hadoop 里需要关注的内容分三类:
/etc/hadoop//usr/local/hadoop/etc/hadoop/(取决于安装方式)dfs.namenode.name.dir# 停止 Hadoop(可选,但最安全)
stop-dfs.sh
stop-yarn.sh
# 备份配置
tar czf hadoop-conf-$(date +%F).tar.gz /etc/hadoop
✅ 建议:每天或每次配置变更后备份
hdfs getconf -confKey dfs.namenode.name.dir
示例输出:
file:///data/hadoop/dfs/name
hdfs dfsadmin -safemode enter
tar czf nn-meta-$(date +%F).tar.gz /data/hadoop/dfs/name
hdfs dfsadmin -safemode leave
✅ 这是恢复集群最关键的部分
distcp(推荐)hadoop distcp hdfs://namenode:8020/ hdfs://backup-nn:8020/backup/
仅适合测试环境。
mysqldump -u root -p hive > hive-meta.sql
hbase snapshot create -n hbase_backup
#!/bin/bash
DATE=$(date +%F)
BACKUP_DIR=/backup/hadoop
mkdir -p $BACKUP_DIR
tar czf $BACKUP_DIR/hadoop-conf-$DATE.tar.gz /etc/hadoop
hdfs dfsadmin -safemode enter
tar czf $BACKUP_DIR/nn-meta-$DATE.tar.gz /data/hadoop/dfs/name
hdfs dfsadmin -safemode leave
加入 crontab:
0 2 * * * /root/backup_hadoop.sh
✅ 必备份
⚠️ 可选
如果你愿意,可以告诉我:
我可以直接给你针对性备份方案。