温馨提示×

温馨提示×

您好,登录后才能下订单哦!

密码登录×
登录注册×
其他方式登录
点击 登录注册 即表示同意《亿速云用户服务条款》

Linux环境Spark安装指南

发布时间:2026-07-01 09:46:49 来源:亿速云 阅读:109 作者:小樊 栏目:系统运维

下面是一份Linux 环境下 Apache Spark 安装指南(通用版),适用于 CentOS / Rocky / Alma / Ubuntu / Debian 等常见发行版。


一、前置条件

1. 操作系统

  • Linux(64 位)
  • 推荐内存 ≥ 4GB(本地模式)
  • 磁盘空间 ≥ 10GB

2. 安装 Java(必须)

Spark 依赖 JDK 8 / 11 / 17

Ubuntu / Debian

sudo apt update
sudo apt install openjdk-11-jdk -y

CentOS / Rocky / Alma

sudo yum install java-11-openjdk-devel -y

验证:

java -version

二、下载 Spark

1. 进入官网

https://spark.apache.org/downloads.html

示例(Spark 3.5.0 + Hadoop 3):

cd /opt
wget https://downloads.apache.org/spark/spark-3.5.0/spark-3.5.0-bin-hadoop3.tgz

2. 解压

tar -zxvf spark-3.5.0-bin-hadoop3.tgz
mv spark-3.5.0-bin-hadoop3 spark

三、配置环境变量

编辑 ~/.bashrc/etc/profile

# Spark
export SPARK_HOME=/opt/spark
export PATH=$SPARK_HOME/bin:$SPARK_HOME/sbin:$PATH

# Java(如未自动识别)
export JAVA_HOME=/usr/lib/jvm/java-11-openjdk

使配置生效:

source ~/.bashrc

验证:

spark-shell --version

四、Spark 运行模式说明

模式 说明
Local 本地单机(学习/测试)
Standalone Spark 自带集群
YARN Hadoop YARN(生产常用)
Kubernetes K8s 容器化

五、Local 模式运行测试(最简单)

1. 启动 Spark Shell

spark-shell

测试代码:

val data = Seq(1,2,3,4)
val rdd = sc.parallelize(data)
rdd.sum()

退出:

:quit

2. 运行示例程序

$SPARK_HOME/bin/run-example SparkPi 10

六、Standalone 集群模式(可选)

1. 配置节点

假设:

  • Master:node1
  • Worker:node2

2. 修改配置

cd $SPARK_HOME/conf
cp spark-env.sh.template spark-env.sh

spark-env.sh

export SPARK_MASTER_HOST=node1
export JAVA_HOME=/usr/lib/jvm/java-11-openjdk

workers 文件:

node2

3. 启动集群

$SPARK_HOME/sbin/start-all.sh

访问 Web UI:

http://node1:8080

七、Spark + Hadoop YARN(生产推荐)

前提

  • 已安装 Hadoop
  • HADOOP_HOME 已配置

提交任务

spark-submit \
--master yarn \
--deploy-mode cluster \
--class org.apache.spark.examples.SparkPi \
$SPARK_HOME/examples/jars/spark-examples_2.12-3.5.0.jar \
10

八、常见问题排查

1. Java 找不到

echo $JAVA_HOME

确认指向 JDK 目录

2. 端口被占用

默认端口:

  • Master UI:8080
  • Worker UI:8081

修改:

export SPARK_MASTER_WEBUI_PORT=8088

3. 内存不足

spark-submit --executor-memory 2G --driver-memory 1G

九、推荐学习路径

✅ Local 模式
✅ spark-shell / pyspark
✅ spark-submit
✅ Standalone → YARN


如果你需要:

  • 单机伪分布式
  • Spark + Hadoop 完整安装
  • Spark + Scala / Python 示例
  • 生产环境调优参数

告诉我你的 Linux 版本和实际需求即可。

向AI问一下细节

免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。

AI