温馨提示×

温馨提示×

您好,登录后才能下订单哦!

密码登录×
登录注册×
其他方式登录
点击 登录注册 即表示同意《亿速云用户服务条款》

如何在 Ubuntu 上安装 Spark

发布时间:2025-10-04 14:11:59 来源:亿速云 阅读:199 作者:小樊 栏目:系统运维

如何在Ubuntu上安装Apache Spark

一、前置准备

在安装Spark前,需确保系统满足以下条件:

  • 操作系统:Ubuntu 20.04及以上版本(推荐LTS版);
  • Java环境:Spark 3.x需Java 8或更高版本(推荐OpenJDK 11);
  • Scala环境(可选):Spark 2.x需Scala 2.12+,Spark 3.x兼容Scala 2.12/2.13;
  • 网络权限:能访问Apache官网下载Spark安装包。

二、系统更新与依赖安装

  1. 更新系统包列表
    打开终端,执行以下命令同步软件源:

    sudo apt update && sudo apt upgrade -y
    
  2. 安装核心依赖
    安装Java(Spark运行基础)、Git(可选,用于代码管理):

    sudo apt install -y openjdk-11-jdk git
    

    验证Java安装:

    java -version  # 应输出OpenJDK 11+版本信息
    javac -version # 验证编译器是否安装
    
  3. (可选)安装Scala
    若需使用Scala API,安装Scala 2.13(兼容Spark 3.x):

    sudo apt install -y scala
    scala -version # 验证版本
    

三、下载与解压Spark

  1. 下载Spark安装包
    访问Apache Spark官网(spark.apache.org),选择最新稳定版(如2025年5月的3.5.5),使用wget下载预编译版(含Hadoop 3支持,无需额外配置Hadoop):

    cd ~/Downloads  # 进入下载目录
    wget https://dlcdn.apache.org/spark/spark-3.5.5/spark-3.5.5-bin-hadoop3.tgz
    
  2. 验证文件完整性(可选但推荐):
    下载对应SHA-512校验文件,检查下载包是否合法:

    wget https://downloads.apache.org/spark/spark-3.5.5/spark-3.5.5-bin-hadoop3.tgz.sha512
    shasum -a 512 -c spark-3.5.5-bin-hadoop3.tgz.sha512  # 输出"OK"则表示合法
    
  3. 解压并移动到系统目录
    解压下载的压缩包,并将Spark移动到/opt目录(系统级软件存放路径):

    tar -xzf spark-3.5.5-bin-hadoop3.tgz -C /opt
    sudo mv /opt/spark-3.5.5-bin-hadoop3 /opt/spark  # 重命名为简洁名称
    

四、配置环境变量

  1. 编辑环境变量文件
    使用nano编辑器打开/etc/profile(系统级配置,对所有用户生效):

    sudo nano /etc/profile
    
  2. 添加Spark环境变量
    在文件末尾添加以下内容(替换/opt/spark为实际解压路径):

    export SPARK_HOME=/opt/spark
    export PATH=$PATH:$SPARK_HOME/bin:$SPARK_HOME/sbin
    export PYSPARK_PYTHON=python3  # 配置PySpark使用Python3
    
  3. 使配置生效
    保存文件(Ctrl+OEnterCtrl+X),执行以下命令加载新配置:

    source /etc/profile
    
  4. 验证环境变量
    执行以下命令,检查SPARK_HOME是否设置正确:

    echo $SPARK_HOME  # 应输出/opt/spark
    

五、验证Spark安装

  1. 启动Spark Shell(Scala API)
    运行以下命令,进入Spark交互式Shell:

    spark-shell
    

    若成功进入,会显示Spark版本信息及交互提示符(scala>),输入spark.version可查看具体版本。

  2. 启动PySpark(Python API)
    运行以下命令,进入PySpark交互式Shell:

    pyspark
    

    输入sc.version可查看Spark版本,sc为SparkContext对象(Spark程序入口)。

  3. 查看Web UI
    启动Spark Shell后,默认会在http://<localhost>:4040开启Web界面,展示任务执行情况、资源使用率等信息。

六、常见问题解决

  • Java版本错误:若java -version显示Java 8,需卸载旧版本并安装Java 11:
    sudo apt remove openjdk-8-jdk
    sudo apt install openjdk-11-jdk
    
  • 环境变量未生效:确保source /etc/profile已执行,或重启终端。
  • PySpark无法运行:检查PYSPARK_PYTHON是否指向正确的Python 3路径(可通过which python3确认)。

通过以上步骤,即可在Ubuntu上完成Spark的单机模式安装与基础验证。如需部署集群模式(Standalone/YARN/Mesos),需进一步配置spark-env.shslaves文件及网络环境,但单机模式已满足开发测试需求。

向AI问一下细节

免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。

AI