温馨提示×

温馨提示×

您好,登录后才能下订单哦!

密码登录×
登录注册×
其他方式登录
点击 登录注册 即表示同意《亿速云用户服务条款》

如何在Linux上高效安装Spark

发布时间:2026-07-01 11:28:49 来源:亿速云 阅读:112 作者:小樊 栏目:系统运维

在 Linux 上高效安装 Apache Spark,关键是根据你的使用场景(单机开发 / 集群 / 结合 Hadoop)选择最简路径。下面按推荐程度给你一套清晰、可复用的方案。


一、最快方式(✅ 单机 / 开发 / 学习推荐)

适合:学习、开发、调试、PySpark、本地测试

1️⃣ 安装前置依赖

sudo apt update
sudo apt install -y openjdk-11-jdk wget curl

检查 Java:

java -version

2️⃣ 下载 Spark(官方预编译版)

wget https://downloads.apache.org/spark/spark-3.5.1/spark-3.5.1-bin-hadoop3.tgz

解压:

tar -xvf spark-3.5.1-bin-hadoop3.tgz
mv spark-3.5.1-bin-hadoop3 ~/spark

3️⃣ 配置环境变量

编辑 ~/.bashrc

export SPARK_HOME=~/spark
export PATH=$SPARK_HOME/bin:$SPARK_HOME/sbin:$PATH

生效:

source ~/.bashrc

4️⃣ 验证安装

spark-shell

或:

pyspark

✅ 成功即完成安装(无需 Hadoop)


二、集群 / 生产环境(Standalone 模式)

1️⃣ 在 Master 节点

cd ~/spark
./sbin/start-master.sh

访问 Web UI:

http://<master-ip>:8080

2️⃣ 在每个 Worker 节点

./sbin/start-worker.sh spark://master-ip:7077

3️⃣ 提交任务

spark-submit \
  --master spark://master-ip:7077 \
  your_app.py

✅ 适合中小规模集群


三、结合 Hadoop / HDFS(企业常用)

推荐方式

直接使用 Spark 官方预编译的 Hadoop 版本

spark-3.5.1-bin-hadoop3.tgz

无需单独安装 Hadoop,只要:

  • HDFS 已运行
  • HADOOP_CONF_DIR 正确
export HADOOP_CONF_DIR=/etc/hadoop/conf

四、使用 Conda(Python 用户最省心 ✅)

适合:数据科学家、PySpark、Jupyter

conda create -n spark_env python=3.10
conda activate spark_env
conda install -c conda-forge pyspark

直接运行:

pyspark

✅ 自动处理依赖,最省事


五、避免常见坑(非常重要)

❌ 不要做的事

  • 不要从源码编译(除非你改 Spark)
  • 不要混用 Java 8 / 11 / 17
  • 不要随意改 spark-env.sh

✅ 推荐配置

export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64

六、安装方式对比(怎么选)

场景 推荐方式
学习 / 本地开发 官方 TGZ
PySpark + Jupyter Conda
小型集群 Spark Standalone
大数据生产 YARN / Kubernetes
云环境 Databricks / EMR

七、我可以继续帮你

你可以直接告诉我:

  • ✅ 单机还是集群?
  • ✅ 是否用 PySpark / Scala / Java?
  • ✅ 是否已有 Hadoop / HDFS?
  • ✅ 内存多大(8G / 16G / 64G)?

我可以直接给你优化后的 spark-defaults.conf 配置

向AI问一下细节

免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。

AI