温馨提示×

linux hadoop怎样入门

小樊
42
2026-10-07 10:15:06
栏目: 智能运维

下面给你一个Linux + Hadoop 入门路线图,适合零基础或刚接触大数据的人,按“先会用,再理解,后实战”的顺序来。


一、先打好 Linux 基础(非常重要)

Hadoop 基本都跑在 Linux 上,命令不会会很吃力。

1. 必学 Linux 基础

重点掌握:

  • 文件与目录
    ls / cd / pwd / mkdir / rm / cp / mv
    
  • 文件查看
    cat / more / less / tail / head
    
  • 权限
    chmod / chown / useradd
    
  • 网络
    ping / ifconfig / netstat
    
  • 进程
    ps / top / kill
    
  • 编辑文件
    vi / vim
    

✅ 建议:装一个 CentOS 7/8 或 Ubuntu 虚拟机练手


二、Hadoop 是什么(先建立概念)

Hadoop 不是一个软件,而是一套生态:

  • HDFS:分布式文件系统(存数据)
  • MapReduce:分布式计算(算数据)
  • YARN:资源调度

常见组件:

  • Hive(SQL 查 Hadoop)
  • HBase(NoSQL)
  • Spark(更快的计算)

三、Hadoop 入门学习路线

阶段 1:单机 / 伪分布式(最重要)

先别搞集群,先跑起来。

1. 环境准备

  • JDK 8(必须)
  • Hadoop 3.x
  • Linux 用户(建议 hadoop 用户)

2. 伪分布式安装

核心配置文件:

  • core-site.xml
  • hdfs-site.xml
  • mapred-site.xml
  • yarn-site.xml

启动:

start-dfs.sh
start-yarn.sh

验证:

jps

看到 NameNode / DataNode 就成功了


阶段 2:HDFS 基本操作

hdfs dfs -ls /
hdfs dfs -put file.txt /
hdfs dfs -cat /file.txt
hdfs dfs -rm /file.txt

阶段 3:跑第一个 MapReduce

  • 官方 example:
hadoop jar hadoop-mapreduce-examples.jar wordcount /input /output

理解:

  • Map:拆分
  • Reduce:汇总

四、推荐学习资源(非常实用)

视频

  • B 站:尚硅谷 Hadoop
  • 黑马 Hadoop 教程

书

  • 《Hadoop 权威指南》(入门后看)
  • 《大数据技术原理与应用》

官方

  • https://hadoop.apache.org

五、新手常见坑

❌ 直接用 root 跑 Hadoop
❌ 不配 SSH 免密登录
❌ 防火墙没关
❌ 只看不动手

✅ 正确方式:一边装一边记笔记


六、你可以这样开始(今天就能做)

  1. 装 VMware + CentOS
  2. 装 JDK
  3. 装 Hadoop 伪分布式
  4. 上传一个 txt 到 HDFS
  5. 跑 wordcount

如果你愿意,我可以:

  • 给你 一步一步的 Hadoop 安装教程
  • 或按你是 学生 / 工作 / 转行 给你定制路线
  • 或帮你 排错(贴报错我帮你看)

你现在是哪种情况?

0 踩