温馨提示×

温馨提示×

您好,登录后才能下订单哦!

密码登录×
登录注册×
其他方式登录
点击 登录注册 即表示同意《亿速云用户服务条款》

安装Spark于Linux的技巧有哪些

发布时间:2026-07-01 10:38:54 来源:亿速云 阅读:117 作者:小樊 栏目:系统运维

在 Linux 上安装 Apache Spark 时,有一些实用技巧和常见坑点,可以让过程更顺利、后续使用更稳定。下面按安装流程 + 优化建议来总结。


一、安装前的准备技巧

1. 选对版本(非常重要)

  • Spark 版本 vs Hadoop 版本要匹配
  • 建议:
    • Spark 3.x + Hadoop 3.x(主流)
    • 如果不用 HDFS,可直接用 Pre-built with user-provided Hadoop

✅ 推荐下载页
https://spark.apache.org/downloads.html


2. 优先使用 OpenJDK,而不是 Oracle JDK

Spark 对 Java 8 / 11 / 17 都支持(3.x 推荐 Java 11)

java -version

安装示例(Java 11):

sudo apt install openjdk-11-jdk   # Ubuntu / Debian
sudo yum install java-11-openjdk  # CentOS / Rocky

✅ 技巧:
避免在一台机器上安装多个 Java 版本,容易迷惑 Spark。


二、下载与解压技巧

1. 使用国内镜像(快很多)

wget https://mirrors.tuna.tsinghua.edu.cn/apache/spark/spark-3.5.0/spark-3.5.0-bin-hadoop3.tgz

2. 解压到固定目录(好习惯)

sudo mkdir -p /opt/spark
sudo tar -xzf spark-3.5.0-bin-hadoop3.tgz -C /opt/spark --strip-components=1

✅ 不建议放在 /home/xxx/Downloads


三、环境配置技巧(关键点)

1. 配置环境变量(强烈推荐)

编辑:

vim ~/.bashrc

添加:

export SPARK_HOME=/opt/spark
export PATH=$SPARK_HOME/bin:$SPARK_HOME/sbin:$PATH
export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64

生效:

source ~/.bashrc

✅ 技巧:
检查是否生效:

echo $SPARK_HOME
spark-shell --version

2. 避免端口冲突(本地模式)

Spark Web UI 默认端口:4040

如果已有服务占用:

spark-shell --conf spark.ui.port=4050

四、运行模式选择技巧

✅ 本地模式(新手/学习首选)

spark-shell --master local[*]
  • local:1 个线程
  • local[2]:2 个线程
  • local[*]:使用所有 CPU

✅ 单机伪分布(进阶)

start-master.sh
start-worker.sh spark://localhost:7077

检查节点:

http://localhost:8080

五、常见坑与解决技巧

1. JAVA_HOME 没找到

报错:

JAVA_HOME is not set

解决:

export JAVA_HOME=$(dirname $(dirname $(readlink -f $(which java))))

2. Python / PySpark 冲突

✅ 推荐做法:

pip install pyspark

如果你用 Anaconda:

conda install pyspark

避免系统 Python 和 Spark 内置 Python 冲突。


3. 内存不足(OOM)

调整:

spark-shell --driver-memory 2g --executor-memory 2g

长期建议: 编辑 $SPARK_HOME/conf/spark-defaults.conf

spark.driver.memory 2g
spark.executor.memory 2g

六、配置调优技巧(生产环境)

1. 复制模板配置文件

cd $SPARK_HOME/conf
cp spark-env.sh.template spark-env.sh

编辑:

export SPARK_MASTER_HOST=your-hostname
export SPARK_WORKER_MEMORY=4g

2. 禁用不需要的服务

如果是纯计算:

  • 不启动 History Server
  • 不启动 Hadoop(除非需要)

七、验证安装是否成功

spark-shell
sc.parallelize(1 to 10).sum()

✅ 能算出来就说明安装成功。


八、总结一句话

安装 Spark 的核心技巧:匹配版本 + 固定目录 + 配置环境变量 + 先用 local 模式验证。

如果你愿意,我可以:

  • ✅ 给你一份 一键安装脚本
  • ✅ 帮你选 Spark + Hadoop + Java 的最佳组合
  • ✅ 指导你 从单机到集群部署

你现在是用于 学习 / 单机分析 / 集群部署 哪一种场景?

向AI问一下细节

免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。

AI