温馨提示×

温馨提示×

您好,登录后才能下订单哦!

密码登录×
登录注册×
其他方式登录
点击 登录注册 即表示同意《亿速云用户服务条款》

Ubuntu 系统如何安装 Spark

发布时间:2025-07-14 06:32:45 来源:亿速云 阅读:118 作者:小樊 栏目:系统运维

在Ubuntu系统上安装Apache Spark的步骤如下:

准备工作

  1. 操作系统:确保您的Ubuntu系统是18.04或更高版本。
  2. 硬件要求:至少需要2GB内存。
  3. 网络连接:确保您的系统能够访问互联网。
  4. Java环境:Spark需要Java 8或更高版本。您可以使用以下命令安装OpenJDK 8:
    sudo apt update
    sudo apt install openjdk-8-jdk
    
    安装完成后,验证Java版本:
    java -version
    

安装步骤

1. 更新系统包列表

sudo apt update
sudo apt upgrade

2. 安装Java(如果尚未安装)

sudo apt install openjdk-8-jdk

验证Java安装:

java -version

3. 下载Spark

从Apache Spark官方网站下载适合Ubuntu的Spark安装包。以下是一个示例命令,下载Spark 2.4.4版本:

wget https://downloads.apache.org/spark/spark-2.4.4/spark-2.4.4-bin-hadoop2.7.tgz

请根据您的系统环境和需求选择合适的Spark版本。

4. 解压Spark安装包

将下载的Spark安装包解压到/opt目录下:

sudo tar -xvf spark-2.4.4-bin-hadoop2.7.tgz -C /opt

5. 设置环境变量

编辑~/.bashrc文件,添加以下行:

export SPARK_HOME=/opt/spark-2.4.4-bin-hadoop2.7
export PATH=$PATH:$SPARK_HOME/bin:$SPARK_HOME/sbin

然后,使环境变量生效:

source ~/.bashrc

6. 启动Spark

在终端中运行以下命令来启动Spark Master:

start-master.sh

然后,使用以下命令启动Spark Shell:

spark-shell

7. 测试Spark

在Spark Shell中,您可以执行以下示例代码来测试Spark是否安装成功:

val data = Seq(1, 2, 3, 4, 5)
val rdd = sc.parallelize(data)
println(rdd.reduce(_ + _))

如果一切正常,您应该会看到输出结果15

可选配置(适用于集群环境)

配置Spark集群

  1. 配置spark-env.sh: 进入$SPARK_HOME/conf目录,复制spark-env.sh.template文件为spark-env.sh,并编辑该文件:

    cp $SPARK_HOME/conf/spark-env.sh.template $SPARK_HOME/conf/spark-env.sh
    nano $SPARK_HOME/conf/spark-env.sh
    

    在文件中添加以下内容(根据您的系统环境进行调整):

    export SPARK_MASTER_HOST="localhost"
    export SPARK_MASTER_PORT="7077"
    export SPARK_WORKER_MEMORY="2g"
    export SPARK_WORKER_CORES="2"
    
  2. 配置slaves: 在$SPARK_HOME/conf目录下,复制slaves.template文件为slaves,并根据您的集群配置添加节点信息:

    cp $SPARK_HOME/conf/slaves.template slaves
    
  3. 启动Spark集群

    • 启动ZooKeeper(如果尚未安装):
      sudo apt install zookeeper
      sudo /opt/zookeeper/bin/zkServer.sh start
      
    • 启动Spark历史服务器
      spark-submit --class org.apache.spark.deploy.history.HistoryServer --master spark://localhost:7077 --port 18080 $SPARK_HOME/lib/spark-history_2.11-3.1.1.jar
      
    • 启动YARN集群:
      start-yarn.sh
      

通过以上步骤,您已经成功在Ubuntu系统上安装并配置了Apache Spark。接下来,您可以开始使用Spark进行大数据处理和分析。

向AI问一下细节

免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。

AI