如何在Ubuntu上安装Apache Spark
在安装Spark前,需确保系统满足以下条件:
更新系统包列表:
打开终端,执行以下命令同步软件源:
sudo apt update && sudo apt upgrade -y
安装核心依赖:
安装Java(Spark运行基础)、Git(可选,用于代码管理):
sudo apt install -y openjdk-11-jdk git
验证Java安装:
java -version # 应输出OpenJDK 11+版本信息
javac -version # 验证编译器是否安装
(可选)安装Scala:
若需使用Scala API,安装Scala 2.13(兼容Spark 3.x):
sudo apt install -y scala
scala -version # 验证版本
下载Spark安装包:
访问Apache Spark官网(spark.apache.org),选择最新稳定版(如2025年5月的3.5.5),使用wget下载预编译版(含Hadoop 3支持,无需额外配置Hadoop):
cd ~/Downloads # 进入下载目录
wget https://dlcdn.apache.org/spark/spark-3.5.5/spark-3.5.5-bin-hadoop3.tgz
验证文件完整性(可选但推荐):
下载对应SHA-512校验文件,检查下载包是否合法:
wget https://downloads.apache.org/spark/spark-3.5.5/spark-3.5.5-bin-hadoop3.tgz.sha512
shasum -a 512 -c spark-3.5.5-bin-hadoop3.tgz.sha512 # 输出"OK"则表示合法
解压并移动到系统目录:
解压下载的压缩包,并将Spark移动到/opt目录(系统级软件存放路径):
tar -xzf spark-3.5.5-bin-hadoop3.tgz -C /opt
sudo mv /opt/spark-3.5.5-bin-hadoop3 /opt/spark # 重命名为简洁名称
编辑环境变量文件:
使用nano编辑器打开/etc/profile(系统级配置,对所有用户生效):
sudo nano /etc/profile
添加Spark环境变量:
在文件末尾添加以下内容(替换/opt/spark为实际解压路径):
export SPARK_HOME=/opt/spark
export PATH=$PATH:$SPARK_HOME/bin:$SPARK_HOME/sbin
export PYSPARK_PYTHON=python3 # 配置PySpark使用Python3
使配置生效:
保存文件(Ctrl+O→Enter→Ctrl+X),执行以下命令加载新配置:
source /etc/profile
验证环境变量:
执行以下命令,检查SPARK_HOME是否设置正确:
echo $SPARK_HOME # 应输出/opt/spark
启动Spark Shell(Scala API):
运行以下命令,进入Spark交互式Shell:
spark-shell
若成功进入,会显示Spark版本信息及交互提示符(scala>),输入spark.version可查看具体版本。
启动PySpark(Python API):
运行以下命令,进入PySpark交互式Shell:
pyspark
输入sc.version可查看Spark版本,sc为SparkContext对象(Spark程序入口)。
查看Web UI:
启动Spark Shell后,默认会在http://<localhost>:4040开启Web界面,展示任务执行情况、资源使用率等信息。
java -version显示Java 8,需卸载旧版本并安装Java 11:sudo apt remove openjdk-8-jdk
sudo apt install openjdk-11-jdk
source /etc/profile已执行,或重启终端。PYSPARK_PYTHON是否指向正确的Python 3路径(可通过which python3确认)。通过以上步骤,即可在Ubuntu上完成Spark的单机模式安装与基础验证。如需部署集群模式(Standalone/YARN/Mesos),需进一步配置spark-env.sh、slaves文件及网络环境,但单机模式已满足开发测试需求。
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。