下面给你一个面向零基础/初学者的 Linux + Hadoop 入门路线,侧重“能跑起来、能理解概念、能动手”。
一、先搞清楚:Linux 和 Hadoop 是什么关系?
- Linux:Hadoop 通常运行在 Linux 上(CentOS / Ubuntu 最常见)
- Hadoop:分布式存储(HDFS)+ 分布式计算(MapReduce / YARN)
- 学习顺序建议:
Linux 基础 → Hadoop 单机/伪分布式 → 集群概念 → 实战项目
二、Linux 入门(必须会)
1. 推荐系统
- 新手:Ubuntu 20.04 / 22.04
- 服务器:CentOS 7(企业常见)
2. 必学 Linux 命令
pwd
ls -l
cd
mkdir
rm -rf
chmod
chown
scp
ssh
ps / top
3. 必会环境配置
- 配置静态 IP(或 NAT)
- 配置 hostname
- 配置 SSH 免密登录(Hadoop 必须)
ssh-keygen
ssh-copy-id hadoop@node1
三、Hadoop 入门路线
阶段 1:单机模式(最快看到效果)
适合:验证 Hadoop 是否安装成功
hadoop jar hadoop-mapreduce-examples.jar wordcount input output
阶段 2:伪分布式(强烈推荐)
一台机器模拟集群
核心配置文件:
core-site.xml
hdfs-site.xml
mapred-site.xml
yarn-site.xml
启动:
start-dfs.sh
start-yarn.sh
访问:
- HDFS:http://localhost:9870
- YARN:http://localhost:8088
四、Hadoop 核心概念(面试/实战常问)
1. HDFS
- NameNode:元数据
- DataNode:真正存数据
- 副本机制(默认 3)
2. YARN
- ResourceManager
- NodeManager
- 负责资源调度
3. MapReduce
五、推荐学习资源(免费)
视频
- B 站:搜「Hadoop 入门 尚硅谷」
- 黑马 / 尚硅谷 Hadoop 教程
文档
- 官方:https://hadoop.apache.org
- 中文博客:CSDN / 知乎入门文章
书
- 《Hadoop 权威指南》(偏厚,可查)
- 《大数据技术原理与应用》(学习友好)
六、新手最常见坑
- JDK 没装或版本不对(必须 JDK 8+)
- SSH 没配免密
- 防火墙没关
- 用户权限混乱(建议专门建 hadoop 用户)
- 配置文件格式写错
七、下一步你可以怎么走?
如果你愿意,我可以:
- ✅ 给你一份 Hadoop 伪分布式详细搭建步骤
- ✅ 用 Ubuntu / CentOS 分别教你
- ✅ 给你一个 WordCount 实战示例
- ✅ 帮你规划 1 个月大数据学习路线
你现在是:
- 完全零基础
- 会 Linux 但不会 Hadoop
- 准备搭集群
告诉我,我直接按你的情况教。