温馨提示×

如何用debian学hadoop

小樊
43
2026-09-11 10:53:53
栏目: 智能运维

Debian 上学习 Hadoop,最推荐的方式是:单机/伪分布式模式起步 → 理解原理 → 再上集群。下面给你一条清晰、可操作的学习路线。


一、准备 Debian 环境

1. 系统要求

  • Debian 11 / 12(推荐)
  • 内存:≥ 4GB(伪分布式够用)
  • 磁盘:≥ 20GB
  • 用户:建议新建一个普通用户(如 hadoop
sudo adduser hadoop
sudo usermod -aG sudo hadoop

二、安装基础依赖

2. 安装 JDK(Hadoop 必须)

sudo apt update
sudo apt install openjdk-11-jdk -y

验证:

java -version

三、下载并安装 Hadoop

3. 下载 Hadoop(以 3.3.x 为例)

wget https://downloads.apache.org/hadoop/common/hadoop-3.3.6/hadoop-3.3.6.tar.gz
tar -xzf hadoop-3.3.6.tar.gz
sudo mv hadoop-3.3.6 /opt/hadoop
sudo chown -R hadoop:hadoop /opt/hadoop

四、配置环境变量

编辑 ~/.bashrc

export HADOOP_HOME=/opt/hadoop
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin
export JAVA_HOME=$(dirname $(dirname $(readlink -f $(which java))))

生效:

source ~/.bashrc

五、伪分布式模式(重点学习用)

4. 修改配置文件

etc/hadoop/core-site.xml

<configuration>
  <property>
    <name>fs.defaultFS</name>
    <value>hdfs://localhost:9000</value>
  </property>
</configuration>

etc/hadoop/hdfs-site.xml

<configuration>
  <property>
    <name>dfs.replication</name>
    <value>1</value>
  </property>
</configuration>

etc/hadoop/mapred-site.xml

<configuration>
  <property>
    <name>mapreduce.framework.name</name>
    <value>yarn</value>
  </property>
</configuration>

etc/hadoop/yarn-site.xml

<configuration>
  <property>
    <name>yarn.nodemanager.aux-services</name>
    <value>mapreduce_shuffle</value>
  </property>
</configuration>

六、SSH 无密码登录(必须)

ssh-keygen -t rsa
cat ~/.ssh/id_rsa.pub >> ~/.ssh/authorized_keys
ssh localhost

七、启动 Hadoop

hdfs namenode -format
start-dfs.sh
start-yarn.sh

查看进程:

jps

应看到:

  • NameNode
  • DataNode
  • ResourceManager
  • NodeManager

Web 界面:

  • HDFS: http://localhost:9870
  • YARN: http://localhost:8088

八、跑第一个 Hadoop 例子

hdfs dfs -mkdir /input
hdfs dfs -put $HADOOP_HOME/etc/hadoop/*.xml /input

yarn jar $HADOOP_HOME/share/hadoop/mapreduce/hadoop-mapreduce-examples-3.3.6.jar wordcount /input /output

hdfs dfs -cat /output/part-r-00000

九、学习路线建议

初级阶段

  • HDFS 原理(块、副本、NameNode)
  • 常用 HDFS 命令
  • MapReduce 执行流程

中级阶段

  • YARN 资源调度
  • 写自己的 MapReduce 程序(Java)
  • 日志与调优

进阶阶段

  • 多节点集群部署
  • Hive / Spark on Hadoop
  • 生产环境配置

十、常见学习资源

  • 官方文档:https://hadoop.apache.org/docs/
  • 《Hadoop权威指南》
  • B站 / MOOC Hadoop 入门课程
  • 自己搭集群比看视频更有效

如果你是:

  • 完全零基础
  • 偏大数据方向
  • 准备面试 / 做实验

可以告诉我,我可以给你定制 “Debian + Hadoop 学习 30 天计划”

0