学习 Linux + Hadoop 可以分为“先打基础 → 搭建环境 → 核心组件 → 实战项目”四个阶段。下面给你一套零基础也能跟的路径。
一、先学 Linux(Hadoop 的基础)
Hadoop 基本都跑在 Linux 上,命令必须熟。
1. 必学 Linux 内容
- 系统登录与用户
- 文件与目录操作
ls / cd / pwd / mkdir / rm / cp / mv
- 文件查看与编辑
cat / less / vi 或 vim
- 权限管理
chmod / chown
- 用户与进程
ps / top / kill / useradd
- 网络基础
ping / netstat / ssh
- 包管理
✅ 建议系统:
- 虚拟机装 CentOS 7/8 或 Ubuntu 20.04+
二、搭建 Hadoop 学习环境
方式推荐(由易到难)
- 单机伪分布式(最推荐入门)
- 虚拟机多节点(3 台)
- Docker / 云服务器(进阶)
学习顺序
- 安装 JDK(Hadoop 依赖)
- 安装 Hadoop
- 配置:
core-site.xml
hdfs-site.xml
mapred-site.xml
yarn-site.xml
- 启动:
✅ 先跑通:
hadoop fs -mkdir /test
hadoop fs -put file.txt /test
三、Hadoop 核心组件(重点)
1. HDFS(存储)
- NameNode / DataNode
- 副本机制
- 常用命令:
hadoop fs -ls /
hadoop fs -cat /file
2. MapReduce(计算)
- Map → Shuffle → Reduce
- 写一个 WordCount(必做)
3. YARN(资源调度)
- ResourceManager
- NodeManager
四、进阶生态(学完再补)
- Hive(SQL 查 Hadoop)
- HBase(列式数据库)
- Spark(比 MapReduce 快)
- Zookeeper
- Flume / Kafka
五、推荐学习资源
视频
- B 站:尚硅谷 / 黑马 Hadoop
- 官方文档(最权威)
书籍
- 《Hadoop 权威指南》
- 《鸟哥的 Linux 私房菜》
六、如果你愿意,我可以:
- 给你 Linux 每日命令表
- 手把手教你 伪分布式搭建
- 给你 WordCount 示例 + 解释
- 按“零基础 30 天计划”安排
你现在是:完全零基础 / 有编程基础 / 想就业用?