可以从 “先会用,再理解,后深入” 的思路快速入门 Linux + Hadoop。下面给你一套 实用型入门路线(1~2 周可跑起来)。
Hadoop 必须跑在 Linux 上,先掌握这些就够用:
# 文件与目录
ls / cd / pwd / mkdir / rm -rf / cp / mv
# 文件查看
cat / less / head / tail
# 权限
chmod / chown
# 进程与网络
ps -ef | grep java
netstat -tunlp
# 解压
tar -zxvf xxx.tar.gz
✅ 建议:
ssh-keygen -t rsa
ssh-copy-id localhost
ssh localhost
✅ Hadoop 依赖 免密 SSH
推荐版本:
安装步骤(简化版):
java -version
wget https://downloads.apache.org/hadoop/common/hadoop-3.3.6/hadoop-3.3.6.tar.gz
tar -zxvf hadoop-3.3.6.tar.gz
export HADOOP_HOME=/path/to/hadoop
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin
core-site.xml
<configuration>
<property>
<name>fs.defaultFS</name>
<value>hdfs://localhost:9000</value>
</property>
</configuration>
hdfs-site.xml
<configuration>
<property>
<name>dfs.replication</name>
<value>1</value>
</property>
</configuration>
hdfs namenode -format
start-dfs.sh
访问:
http://localhost:9870
✅ 看到 Web UI = 成功
hdfs dfs -ls /
hdfs dfs -mkdir /test
hdfs dfs -put file.txt /test
hdfs dfs -cat /test/file.txt
hdfs dfs -rm -r /test
✅ 目标:
把 HDFS 当成“分布式硬盘”用
hadoop jar $HADOOP_HOME/share/hadoop/mapreduce/hadoop-mapreduce-examples-*.jar wordcount /input /output
✅ 理解:
| 组件 | 作用 |
|---|---|
| HDFS | 分布式存储 |
| YARN | 资源调度 |
| MapReduce | 计算模型 |
❌ Java 版本不对
❌ SSH 没配免密
❌ 防火墙没关
❌ 多次 format namenode
❌ 用 root 跑 Hadoop(建议普通用户)
| 时间 | 内容 |
|---|---|
| 第 1 天 | Linux 基础 + SSH |
| 第 2~3 天 | Hadoop 安装 + HDFS |
| 第 4~5 天 | MapReduce 示例 |
| 第 6~7 天 | 跑 Hive / 看 YARN |
如果你愿意,我可以:
你现在用的是 Windows / Mac / Linux?