温馨提示×

怎么学debian hadoop

小樊
45
2026-09-08 13:13:26
栏目: 智能运维

学习 Debian 上搭建和使用 Hadoop,可以按下面这条路线来,从基础到实战,比较稳妥。


一、先打基础(不急着装 Hadoop)

1. 熟悉 Debian

你需要掌握:

  • 基本命令:apt, systemctl, ssh, useradd, scp
  • 网络配置(静态 IP、hostname)
  • 权限和用户管理
  • 防火墙(ufw / iptables)

推荐:

man apt
man systemctl

2. 学习 Java(Hadoop 依赖)

Hadoop 是 Java 写的:

  • 安装 JDK(OpenJDK 即可)
sudo apt install openjdk-17-jdk
java -version

二、理解 Hadoop 是什么(很重要)

不要一上来就敲命令,先搞清楚:

  • HDFS:分布式文件系统
  • MapReduce:计算模型
  • YARN:资源调度

简单理解:

Hadoop = 多台机器一起存数据 + 一起算任务


三、在 Debian 上搭建 Hadoop(单机 → 伪分布 → 集群)

阶段 1:单机模式(最快入门)

适合理解概念

wget https://archive.apache.org/dist/hadoop/common/hadoop-3.3.6/hadoop-3.3.6.tar.gz
tar -xzf hadoop-3.3.6.tar.gz
cd hadoop-3.3.6

配置 JAVA_HOME

nano etc/hadoop/hadoop-env.sh
export JAVA_HOME=/usr/lib/jvm/java-17-openjdk-amd64

运行示例:

bin/hadoop jar share/hadoop/mapreduce/hadoop-mapreduce-examples-3.3.6.jar wordcount input output

阶段 2:伪分布式(重点)

这是学习 Hadoop 最核心的一步

需要配置:

  • core-site.xml
  • hdfs-site.xml
  • mapred-site.xml
  • yarn-site.xml

关键步骤:

ssh-keygen
ssh-copy-id localhost

格式化 HDFS:

bin/hdfs namenode -format

启动:

sbin/start-dfs.sh
sbin/start-yarn.sh

浏览器访问:

  • HDFS: http://localhost:9870
  • YARN: http://localhost:8088

阶段 3:多机集群(进阶)

需要:

  • 多台 Debian 机器
  • hostname 互通
  • SSH 免密
  • 时间同步(NTP)

角色:

  • 1 台 NameNode
  • 多台 DataNode

四、学习资源推荐

官方文档(最权威)

https://hadoop.apache.org/docs/stable/

中文资料

  • 《Hadoop 权威指南》
  • B 站搜索:Hadoop 伪分布式 搭建

练习方向

  • HDFS 命令(put / get / ls)
  • 写 WordCount(Java / Python)
  • 用 Hive / Spark 接 Hadoop

五、常见坑(Debian 特有问题)

  • Java 版本不兼容(用 LTS 版本)
  • hostname 没改导致启动失败
  • 权限问题(不要用 root 跑 Hadoop)
  • 防火墙挡端口

如果你愿意,我可以:

  • 给你一份 Debian + Hadoop 伪分布式完整配置
  • 或按你水平(零基础 / 有 Linux 基础)定制学习路线

你现在是哪一步?

0