下面给你一个Linux + Hadoop 入门路线图,适合零基础或刚接触大数据的人,按“先会用,再理解,后实战”的顺序来。
Hadoop 基本都跑在 Linux 上,命令不会会很吃力。
重点掌握:
ls / cd / pwd / mkdir / rm / cp / mv
cat / more / less / tail / head
chmod / chown / useradd
ping / ifconfig / netstat
ps / top / kill
vi / vim
✅ 建议:装一个 CentOS 7/8 或 Ubuntu 虚拟机练手
Hadoop 不是一个软件,而是一套生态:
常见组件:
先别搞集群,先跑起来。
核心配置文件:
core-site.xmlhdfs-site.xmlmapred-site.xmlyarn-site.xml启动:
start-dfs.sh
start-yarn.sh
验证:
jps
看到 NameNode / DataNode 就成功了
hdfs dfs -ls /
hdfs dfs -put file.txt /
hdfs dfs -cat /file.txt
hdfs dfs -rm /file.txt
hadoop jar hadoop-mapreduce-examples.jar wordcount /input /output
理解:
❌ 直接用 root 跑 Hadoop
❌ 不配 SSH 免密登录
❌ 防火墙没关
❌ 只看不动手
✅ 正确方式:一边装一边记笔记
如果你愿意,我可以:
你现在是哪种情况?