下面是一份Linux 环境下 Apache Spark 安装指南(通用版),适用于 CentOS / Rocky / Alma / Ubuntu / Debian 等常见发行版。
Spark 依赖 JDK 8 / 11 / 17
sudo apt update
sudo apt install openjdk-11-jdk -y
sudo yum install java-11-openjdk-devel -y
验证:
java -version
https://spark.apache.org/downloads.html
示例(Spark 3.5.0 + Hadoop 3):
cd /opt
wget https://downloads.apache.org/spark/spark-3.5.0/spark-3.5.0-bin-hadoop3.tgz
tar -zxvf spark-3.5.0-bin-hadoop3.tgz
mv spark-3.5.0-bin-hadoop3 spark
编辑 ~/.bashrc 或 /etc/profile:
# Spark
export SPARK_HOME=/opt/spark
export PATH=$SPARK_HOME/bin:$SPARK_HOME/sbin:$PATH
# Java(如未自动识别)
export JAVA_HOME=/usr/lib/jvm/java-11-openjdk
使配置生效:
source ~/.bashrc
验证:
spark-shell --version
| 模式 | 说明 |
|---|---|
| Local | 本地单机(学习/测试) |
| Standalone | Spark 自带集群 |
| YARN | Hadoop YARN(生产常用) |
| Kubernetes | K8s 容器化 |
spark-shell
测试代码:
val data = Seq(1,2,3,4)
val rdd = sc.parallelize(data)
rdd.sum()
退出:
:quit
$SPARK_HOME/bin/run-example SparkPi 10
假设:
node1node2cd $SPARK_HOME/conf
cp spark-env.sh.template spark-env.sh
spark-env.sh:
export SPARK_MASTER_HOST=node1
export JAVA_HOME=/usr/lib/jvm/java-11-openjdk
workers 文件:
node2
$SPARK_HOME/sbin/start-all.sh
访问 Web UI:
http://node1:8080
HADOOP_HOME 已配置spark-submit \
--master yarn \
--deploy-mode cluster \
--class org.apache.spark.examples.SparkPi \
$SPARK_HOME/examples/jars/spark-examples_2.12-3.5.0.jar \
10
echo $JAVA_HOME
确认指向 JDK 目录
默认端口:
修改:
export SPARK_MASTER_WEBUI_PORT=8088
spark-submit --executor-memory 2G --driver-memory 1G
✅ Local 模式
✅ spark-shell / pyspark
✅ spark-submit
✅ Standalone → YARN
如果你需要:
告诉我你的 Linux 版本和实际需求即可。
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。