温馨提示×

温馨提示×

您好,登录后才能下订单哦!

密码登录×
登录注册×
其他方式登录
点击 登录注册 即表示同意《亿速云用户服务条款》

Spark在Linux的安装与配置

发布时间:2026-07-01 09:52:48 来源:亿速云 阅读:111 作者:小樊 栏目:系统运维

下面给你一份 在 Linux 上安装与配置 Apache Spark 的完整入门指南。以 Spark 3.x + Hadoop 3.x + Linux(CentOS / Ubuntu 通用) 为例,适合学习和单机/伪分布式使用。


一、环境准备

1. 系统要求

  • Linux(CentOS 7/8、Ubuntu 20.04+ 均可)
  • Java 8 或 Java 11(推荐 Java 8)
  • 至少 4GB 内存(学习环境)

2. 检查 Java

java -version

若未安装:

Ubuntu

sudo apt update
sudo apt install openjdk-8-jdk

CentOS

sudo yum install java-1.8.0-openjdk java-1.8.0-openjdk-devel

设置环境变量:

export JAVA_HOME=/usr/lib/jvm/java-1.8.0-openjdk

二、下载与安装 Spark

1. 下载 Spark

官网:https://spark.apache.org/downloads.html

示例(Spark 3.5.0 + Hadoop 3):

wget https://downloads.apache.org/spark/spark-3.5.0/spark-3.5.0-bin-hadoop3.tgz

2. 解压

tar -zxvf spark-3.5.0-bin-hadoop3.tgz
mv spark-3.5.0-bin-hadoop3 /usr/local/spark

三、配置环境变量

编辑 ~/.bashrc~/.bash_profile

export SPARK_HOME=/usr/local/spark
export PATH=$SPARK_HOME/bin:$SPARK_HOME/sbin:$PATH

生效:

source ~/.bashrc

四、Spark 基础配置

1. 复制配置文件

cd $SPARK_HOME/conf
cp spark-env.sh.template spark-env.sh
cp slaves.template slaves   # 单机可跳过

2. 编辑 spark-env.sh

export JAVA_HOME=/usr/lib/jvm/java-1.8.0-openjdk
export SPARK_MASTER_HOST=localhost
export SPARK_WORKER_MEMORY=2g
export SPARK_WORKER_CORES=2

五、启动 Spark(单机模式)

1. 本地模式(最常用)

spark-shell

或运行 Python:

pyspark

2. Standalone 模式(伪分布式)

$SPARK_HOME/sbin/start-master.sh
$SPARK_HOME/sbin/start-worker.sh spark://localhost:7077

Web UI:

http://localhost:8080

停止:

$SPARK_HOME/sbin/stop-all.sh

六、验证是否安装成功

1. 运行示例

run-example SparkPi 10

2. 查看版本

spark-submit --version

七、Spark 提交任务示例

spark-submit \
  --master local[*] \
  --class org.apache.spark.examples.SparkPi \
  $SPARK_HOME/examples/jars/spark-examples_2.12-3.5.0.jar \
  100

八、常见问题

1. JAVA_HOME not set

echo $JAVA_HOME

如为空,说明 Java 环境变量未配置。

2. 端口占用

netstat -tunlp | grep 7077

3. 内存不足

减少 worker 内存:

export SPARK_WORKER_MEMORY=1g

九、Spark 运行模式总结

模式 说明 命令
local 本地单线程 local
local[N] 本地多线程 local[4]
standalone 自带集群 spark://host:7077
YARN Hadoop 集群 yarn

如果你需要:

  • Spark + Hadoop HA
  • 完全分布式集群部署
  • Spark on YARN 配置
  • 生产环境调优参数

可以直接告诉我你的使用场景(学习 / 工作 / 集群规模)。

向AI问一下细节

免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。

AI