温馨提示×

怎样学debian的hadoop

小樊
39
2026-09-14 16:03:36
栏目: 智能运维

学习在 Debian 系统上搭建和使用 Hadoop,可以按下面这套路线来,从基础到实战,循序渐进。


一、先打基础(很重要)

1. Linux / Debian 基础

Hadoop 跑在 Linux 上,至少要会:

  • 用户与权限(useradd, sudo, chmod, chown
  • 网络配置(IP、主机名、/etc/hosts
  • SSH 免密登录(Hadoop 必需)
  • 包管理(apt

✅ 建议:

sudo apt update
sudo apt install -y ssh rsync openjdk-11-jdk

2. Java 基础

Hadoop 是 Java 写的:

  • 安装 JDK(推荐 Java 8 或 11)
  • 配置 JAVA_HOME
java -version
echo $JAVA_HOME

二、Hadoop 核心概念(先理解,再装)

不要一上来就敲命令,先搞清楚:

  • HDFS:分布式文件系统
  • YARN:资源调度
  • MapReduce:计算模型
  • 角色:
    • NameNode / DataNode
    • ResourceManager / NodeManager

三、在 Debian 上安装 Hadoop(单机 / 伪分布式)

1. 下载 Hadoop

wget https://downloads.apache.org/hadoop/common/hadoop-3.3.6/hadoop-3.3.6.tar.gz
tar -xzf hadoop-3.3.6.tar.gz
sudo mv hadoop-3.3.6 /opt/hadoop

2. 配置环境变量

~/.bashrc

export HADOOP_HOME=/opt/hadoop
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin
export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64
source ~/.bashrc

3. 伪分布式配置(最常用学习方式)

etc/hadoop/core-site.xml

<configuration>
  <property>
    <name>fs.defaultFS</name>
    <value>hdfs://localhost:9000</value>
  </property>
</configuration>

etc/hadoop/hdfs-site.xml

<configuration>
  <property>
    <name>dfs.replication</name>
    <value>1</value>
  </property>
</configuration>

SSH 免密

ssh-keygen -t rsa
cat ~/.ssh/id_rsa.pub >> ~/.ssh/authorized_keys

4. 启动 Hadoop

hdfs namenode -format
start-dfs.sh
start-yarn.sh

浏览器访问:

  • HDFS: http://localhost:9870
  • YARN: http://localhost:8088

四、动手实践(关键)

1. HDFS 操作

hdfs dfs -mkdir /test
hdfs dfs -put file.txt /test
hdfs dfs -ls /

2. 跑 MapReduce 示例

hadoop jar $HADOOP_HOME/share/hadoop/mapreduce/hadoop-mapreduce-examples-3.3.6.jar wordcount /test /out

五、进阶学习路线

1. 集群部署(多台 Debian)

  • 多机 hosts
  • 多 NameNode / DataNode
  • 真正分布式

2. 生态组件

  • Hive(SQL)
  • HBase(NoSQL)
  • Spark(计算)
  • ZooKeeper

3. 运维

  • 日志分析
  • 性能调优
  • 故障恢复

六、推荐学习资源

书籍

  • 《Hadoop权威指南》(O’Reilly)
  • 《Hadoop实战》

教程

  • 官方文档:https://hadoop.apache.org/docs/
  • 尚硅谷 / 黑马 Hadoop 视频(中文友好)

练习平台

  • 自己 Debian 虚拟机
  • Docker + Hadoop
  • 云服务器(轻量)

七、学习建议(少走弯路)

✅ 先单机,再集群
✅ 先会用,再懂原理
✅ 多敲命令,少复制粘贴
✅ 出错看日志(logs/ 目录)


如果你愿意,我可以:

  • 给你一套 Debian + Hadoop 安装脚本
  • 帮你 规划学习时间表
  • 或你现在是 零基础 / 有 Linux 基础 / 有 Java 基础?我可以按你的情况定制路线

0