温馨提示×

温馨提示×

您好,登录后才能下订单哦!

密码登录×
登录注册×
其他方式登录
点击 登录注册 即表示同意《亿速云用户服务条款》

linux spark安装需要啥配置

发布时间:2026-09-26 15:32:16 来源:亿速云 阅读:83 作者:小樊 栏目:系统运维

在 Linux 上安装和运行 Apache Spark,需要准备以下几类配置和环境。下面按“必须 / 推荐 / 可选”给你梳理清楚。


一、必须配置(基础环境)

1. 操作系统

  • 主流 Linux 发行版均可:
    • CentOS / Rocky / Alma
    • Ubuntu / Debian
    • openEuler 等
  • 建议 64 位系统

2. Java(JDK)

Spark 依赖 JVM:

  • Spark 3.x:推荐 JDK 8 / JDK 11
  • Spark 4.x:推荐 JDK 17

安装示例(Ubuntu):

sudo apt install openjdk-11-jdk

配置 JAVA_HOME:

export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64
export PATH=$JAVA_HOME/bin:$PATH

3. Spark 安装包

  • 下载地址:https://spark.apache.org/downloads.html
  • 选择:
    • Spark 版本(如 3.5.1)
    • Package Type:Pre-built for Hadoop(最常用)

解压即可,无需编译:

tar -xzf spark-3.5.1-bin-hadoop3.tgz
mv spark-3.5.1-bin-hadoop3 /opt/spark

4. 配置环境变量

export SPARK_HOME=/opt/spark
export PATH=$SPARK_HOME/bin:$PATH

二、运行模式相关配置

1. 本地模式(学习 / 测试)

✅ 不需要额外组件
直接运行:

spark-shell

或

pyspark

2. Standalone 模式(Spark 自带集群)

需要配置:

$SPARK_HOME/conf/spark-env.sh

示例:

export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64
export SPARK_MASTER_HOST=192.168.1.10
export SPARK_WORKER_CORES=4
export SPARK_WORKER_MEMORY=8g

slaves 文件(旧版本):

worker1
worker2

3. YARN 模式(生产常用)

需要:

  • Hadoop 集群
  • HADOOP_CONF_DIR 指向 Hadoop 配置目录
export HADOOP_CONF_DIR=/etc/hadoop/conf

提交示例:

spark-submit --master yarn ...

4. Kubernetes 模式(云原生)

需要:

  • K8s 集群
  • kubectl 可用
  • 镜像仓库

三、推荐配置(生产环境)

1. 内存 & CPU

  • Worker 节点:
    • 内存 ≥ 8G(生产建议 16G+)
    • CPU ≥ 4 核

2. 文件描述符

ulimit -n 65536

3. 关闭 swap(可选但推荐)

swapoff -a

四、Python 支持(PySpark)

需要:

pip install pyspark

或系统 Python ≥ 3.7


五、最小安装清单(速查)

✅ 必须:

  • Linux
  • JDK 8/11/17
  • Spark 二进制包
  • JAVA_HOME / SPARK_HOME

✅ 生产额外:

  • Hadoop(YARN)
  • 集群节点配置
  • 资源限制调整

如果你愿意,可以告诉我:

  • 你是 学习 / 测试 / 生产
  • 用 Scala / Python
  • 是否使用 Hadoop / K8s

我可以直接给你一套对应场景的安装步骤。

向AI问一下细节

免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。

AI
助
手