温馨提示×

温馨提示×

您好,登录后才能下订单哦!

密码登录×
登录注册×
其他方式登录
点击 登录注册 即表示同意《亿速云用户服务条款》

linux spark怎么装

发布时间:2026-09-06 01:13:50 来源:亿速云 阅读:82 作者:小樊 栏目:系统运维

下面给你 Linux 上安装 Spark 的常用、可靠步骤,以 单机/本地模式(最常用) 为例,也包含 集群模式的简要说明


一、前置条件(必须)

Spark 依赖 Java,推荐:

  • Java 8 / Java 11(Spark 3.x 推荐 Java 8 或 11)

1. 安装 Java

# Ubuntu / Debian
sudo apt update
sudo apt install openjdk-11-jdk -y

# CentOS / Rocky / Alma
sudo yum install java-11-openjdk-devel -y

检查:

java -version

二、下载 Spark(Linux 二进制包)

2. 下载 Spark

去官网:https://spark.apache.org/downloads.html

例如(Spark 3.5.x):

cd /opt
sudo wget https://archive.apache.org/dist/spark/spark-3.5.1/spark-3.5.1-bin-hadoop3.tgz
sudo tar -xzf spark-3.5.1-bin-hadoop3.tgz
sudo mv spark-3.5.1-bin-hadoop3 spark

三、配置环境变量

sudo vim /etc/profile.d/spark.sh

写入:

export SPARK_HOME=/opt/spark
export PATH=$PATH:$SPARK_HOME/bin

生效:

source /etc/profile.d/spark.sh

验证:

spark-submit --version

四、本地模式运行测试

1. 启动 Spark Shell

spark-shell

看到 scala> 说明成功。

2. 简单测试

val data = Seq(1,2,3,4)
val rdd = sc.parallelize(data)
rdd.reduce(_ + _)

五、Python 使用 Spark(PySpark)

安装 Python

sudo apt install python3 python3-pip -y

使用 PySpark

pyspark

或写脚本:

from pyspark.sql import SparkSession

spark = SparkSession.builder.appName("test").getOrCreate()
df = spark.range(10)
df.show()
spark.stop()

六、集群模式(简单说明)

如果你要 Standalone 集群

# 主节点
$SPARK_HOME/sbin/start-master.sh

# 工作节点
$SPARK_HOME/sbin/start-worker.sh spark://master-ip:7077

七、常见错误

问题 原因
JAVA_HOME not set 未配置 Java
Unsupported major.minor Java 版本不对
端口占用 7077 / 8080 被占用

八、我可以继续帮你的

你可以告诉我:

  • ✅ Ubuntu / CentOS / 服务器
  • ✅ 本地用还是集群?
  • ✅ Scala / Python?
  • ✅ 是否要接 Hadoop / Hive?

我可以直接给你 一步一步可复制命令

向AI问一下细节

免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。

AI