学习 Linux + Hadoop 入门,建议按「先 Linux 基础 → 再 Hadoop 原理 → 再动手搭建」的顺序来。下面给你一条比较清晰、适合新手的路线。
一、先学 Linux 基础(必须)
Hadoop 基本都跑在 Linux 上,不会 Linux 很难学下去。
1. 基本环境
- 装一个 Linux(推荐)
- Ubuntu(新手友好)
- CentOS / Rocky Linux(偏服务器)
- 方式
- 虚拟机(VMware / VirtualBox)
- WSL(Windows 用户)
2. 必学 Linux 命令
重点掌握这些就够入门:
cd / ls / pwd
mkdir / rm / cp / mv
touch / cat / less / tail
chmod / chown
ps / top / kill
tar / zip / unzip
scp / rsync
vim / nano
3. 用户与权限
4. 网络基础
- IP、端口
- ssh 登录
- 防火墙(firewalld / ufw)
✅ 目标:能自己登录 Linux、建目录、传文件、跑命令
二、了解 Hadoop 是什么(先懂概念)
不要一上来就死磕搭建。
1. Hadoop 解决什么问题
- 海量数据存储(HDFS)
- 海量数据计算(MapReduce)
2. 核心组件
- HDFS:分布式文件系统
- NameNode(老大)
- DataNode(干活的)
- YARN:资源管理
- MapReduce:计算模型
3. 常见生态(先知道名字)
- Hive(SQL)
- HBase(数据库)
- Spark(计算,比 MR 快)
- Flume / Kafka(数据采集)
✅ 目标:能说清楚 Hadoop 是干嘛的
三、动手搭一个伪分布式 Hadoop(关键)
新手强烈建议先搭「伪分布式」,不是生产,但能学原理。
1. 准备
- Linux 一台
- JDK 8(Hadoop 3.x 也支持 JDK 8/11)
- Hadoop 3.x
2. 安装步骤(简化版)
- 安装 JDK
- 配置 SSH 免密登录
- 下载并解压 Hadoop
- 修改配置文件
core-site.xml
hdfs-site.xml
mapred-site.xml
yarn-site.xml
- 格式化 HDFS
- 启动 Hadoop
3. 常用命令
hdfs dfs -ls /
hdfs dfs -put file.txt /
hdfs dfs -cat file.txt
start-dfs.sh
start-yarn.sh
jps
✅ 目标:能启动 Hadoop,上传文件,跑 WordCount
四、跑第一个 MapReduce 程序(WordCount)
这是 Hadoop 的“Hello World”。
hadoop jar hadoop-mapreduce-examples.jar wordcount input output
理解:
五、学习资源推荐
视频(B站搜)
- “Hadoop 入门教程”
- “Linux 基础教程”
- 尚硅谷 / 黑马 的 Hadoop 课程(质量不错)
文档
- Hadoop 官方文档(英文,但最准)
- 菜鸟教程(中文,入门友好)
书(不急)
六、学习路线总结
Linux 基础
↓
Hadoop 概念
↓
伪分布式搭建
↓
HDFS 命令
↓
MapReduce 示例
↓
YARN / 生态组件
如果你愿意,我可以:
- 给你一份 Linux 入门命令清单
- 或一步步教你 搭伪分布式 Hadoop
- 或按你是「学生 / 转行 / 运维 / 开发」给你定制路线
你现在是哪种情况?