温馨提示×

linux hdfs配置怎样集成

小樊
46
2026-09-10 12:39:23
栏目: 智能运维

下面按**“Linux 上安装并配置 HDFS,并让客户端/应用集成使用”**的思路,给你一个清晰、可落地的说明。


一、HDFS 基本架构说明

HDFS 由两类核心角色组成:

  • NameNode:元数据管理(主节点)
  • DataNode:实际数据存储(从节点)

单机也可伪分布式运行(开发/测试常用)。


二、Linux 环境准备

1. 系统要求

  • Linux(CentOS / Ubuntu 均可)
  • JDK 8 或以上
  • 已配置 SSH 免密(伪分布式必须)
java -version
ssh localhost

生成 SSH key(如未配置):

ssh-keygen -t rsa
cat ~/.ssh/id_rsa.pub >> ~/.ssh/authorized_keys
chmod 600 ~/.ssh/authorized_keys

三、Hadoop 安装与 HDFS 配置

1. 下载并解压

wget https://archive.apache.org/dist/hadoop/common/hadoop-3.3.6/hadoop-3.3.6.tar.gz
tar -zxvf hadoop-3.3.6.tar.gz -C /opt

2. 配置环境变量

export HADOOP_HOME=/opt/hadoop-3.3.6
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin

3. 修改 HDFS 核心配置文件

(1)etc/hadoop/hadoop-env.sh

export JAVA_HOME=/usr/java/jdk1.8.0_xxx

(2)etc/hadoop/core-site.xml

<configuration>
  <property>
    <name>fs.defaultFS</name>
    <value>hdfs://localhost:9000</value>
  </property>
</configuration>

(3)etc/hadoop/hdfs-site.xml

<configuration>
  <property>
    <name>dfs.replication</name>
    <value>1</value>
  </property>
  <property>
    <name>dfs.namenode.name.dir</name>
    <value>/opt/hadoop/data/namenode</value>
  </property>
  <property>
    <name>dfs.datanode.data.dir</name>
    <value>/opt/hadoop/data/datanode</value>
  </property>
</configuration>

四、启动 HDFS

1. 格式化 NameNode

hdfs namenode -format

2. 启动 HDFS

start-dfs.sh

3. 验证

jps

应看到:

  • NameNode
  • DataNode
  • SecondaryNameNode

Web UI:

http://localhost:9870

五、Linux 客户端集成 HDFS

1. 命令行使用

hdfs dfs -mkdir /test
hdfs dfs -put file.txt /test
hdfs dfs -ls /test

2. 应用集成方式

(1)Java 集成

<dependency>
  <groupId>org.apache.hadoop</groupId>
  <artifactId>hadoop-client</artifactId>
  <version>3.3.6</version>
</dependency>
Configuration conf = new Configuration();
conf.set("fs.defaultFS", "hdfs://localhost:9000");
FileSystem fs = FileSystem.get(conf);

(2)Spring Boot 集成

  • 使用 hadoop-client
  • 配置 fs.defaultFS
  • 注入 FileSystem

(3)Linux 挂载(FUSE,可选)

yum install hadoop-hdfs-fuse
hadoop-fuse-dfs dfs://localhost:9000 /mnt/hdfs

六、常见集成场景

场景 集成方式
日志存储 Flume / Logstash → HDFS
大数据计算 Spark / MapReduce
数据仓库 Hive on HDFS
文件共享 HDFS + NFS Gateway

七、常见问题

  • 权限问题:使用 hdfs dfs -chmod
  • 端口不通:检查防火墙
  • DataNode 起不来:检查 data.dir 权限

如果你愿意,我可以:

  • 给你 生产集群(多节点)配置
  • 给你 Docker 一键部署 HDFS
  • 给你 Spring Boot 完整示例

你现在是 学习 / 开发 / 生产 场景?

0 踩