温馨提示×

温馨提示×

您好,登录后才能下订单哦!

密码登录×
登录注册×
其他方式登录
点击 登录注册 即表示同意《亿速云用户服务条款》

Spark 在 Linux 怎么安装

发布时间:2025-10-04 14:43:57 来源:亿速云 阅读:128 作者:小樊 栏目:系统运维

1. 环境准备
在Linux系统上安装Spark前,需确保以下依赖已正确配置:

  • Java环境:Spark依赖Java运行,推荐安装JDK 8或JDK 11(兼容性最佳)。可通过java -version命令验证,若未安装,使用系统包管理器安装(如Ubuntu/Debian执行sudo apt install openjdk-8-jdk,CentOS/RHEL执行sudo yum install java-1.8.0-openjdk)。
  • Hadoop(可选):若需使用HDFS、YARN等Hadoop组件,需提前安装Hadoop并配置环境变量(如HADOOP_HOME);仅本地测试可跳过。
  • Python(可选):若使用PySpark(Spark的Python API),需安装Python 3(推荐3.6及以上版本),可通过python3 --version验证,未安装时使用sudo yum install python3(CentOS)或sudo apt install python3(Ubuntu)安装。

2. 下载Spark安装包
从Apache Spark官方网站下载最新稳定版本(如Spark 3.3.2),选择预编译的Hadoop版本(如spark-3.3.2-bin-hadoop3.tgz,适配Hadoop 3.x),使用wget命令下载至Linux服务器

wget https://downloads.apache.org/spark/spark-3.3.2/spark-3.3.2-bin-hadoop3.tgz

3. 解压安装包
将下载的安装包解压至指定目录(如/opt,需管理员权限),并重命名文件夹以便管理:

sudo tar -xzf spark-3.3.2-bin-hadoop3.tgz -C /opt
sudo mv /opt/spark-3.3.2-bin-hadoop3 /opt/spark

4. 配置环境变量
编辑用户或系统的环境变量文件(如~/.bashrc/etc/profile),添加Spark相关变量:

export SPARK_HOME=/opt/spark  # Spark安装目录
export PATH=$SPARK_HOME/bin:$PATH  # 将Spark命令加入PATH

保存后执行source ~/.bashrc(或source /etc/profile)使配置立即生效。

5. 配置Spark参数
进入Spark安装目录的conf子目录,完成以下配置:

  • 复制模板文件:将spark-env.sh.template重命名为spark-env.sh(用于设置Spark环境变量):
    cd /opt/spark/conf
    cp spark-env.sh.template spark-env.sh
    
  • 编辑spark-env.sh:添加Java路径(根据实际安装位置调整)、Master节点主机名(本地测试用localhost):
    export JAVA_HOME=/usr/lib/jvm/java-8-openjdk-amd64  # 替换为你的Java安装路径
    export SPARK_MASTER_HOST=localhost
    
  • 可选:配置Slaves文件(集群模式):若搭建多节点集群,需将slaves.template重命名为slaves,并在文件中添加Worker节点的主机名(每行一个)。

6. 验证安装

  • 本地模式测试:运行spark-shell命令,若出现Scala REPL界面(显示Spark context available as 'sc'),说明安装成功:
    $SPARK_HOME/bin/spark-shell
    
  • Web UI验证:访问http://<your-server-ip>:8080(默认端口),若能看到Spark Master的Web界面(显示集群状态、Worker节点),则配置生效。

7. 启动Spark集群(可选,Standalone模式)

  • 启动Master节点:在Master服务器上执行:
    $SPARK_HOME/sbin/start-master.sh
    
  • 启动Worker节点:在Master或Worker服务器上执行(若为集群模式,需在Worker节点执行):
    $SPARK_HOME/sbin/start-slave.sh spark://<master-ip>:7077
    
  • 验证进程:使用jps命令查看是否启动了MasterWorker进程。

常见问题解决

  • Java版本不兼容:若出现Unsupported major.minor version错误,需安装JDK 8或11并更新JAVA_HOME
  • 端口冲突:若8080端口被占用,可在spark-env.sh中修改SPARK_MASTER_PORT(如export SPARK_MASTER_PORT=8081)。
  • 内存不足:若启动时报内存不足,可在spark-defaults.conf中调整内存配置(如spark.executor.memory 1gspark.driver.memory 1g)。
向AI问一下细节

免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。

AI