温馨提示×

温馨提示×

您好,登录后才能下订单哦!

密码登录×
登录注册×
其他方式登录
点击 登录注册 即表示同意《亿速云用户服务条款》

如何在 Linux 上安装 Spark 集群

发布时间:2025-06-02 22:56:43 来源:亿速云 阅读:132 作者:小樊 栏目:系统运维

在 Linux 上安装 Spark 集群可以分为几个步骤,以下是详细的指南:

1. 环境准备

  • 安装 Java:

    • 确保系统已安装 Java 运行时环境。可以通过以下命令检查 Java 是否已安装:
      java -version
      
    • 如果没有安装 Java,可以通过以下命令安装 OpenJDK:
      sudo apt-get update
      sudo apt-get install openjdk-8-jdk
      
  • 修改主机名:

    • 修改每台主机的主机名,以便在集群中识别。例如,在 master 节点上修改为 master,在 slave 节点上分别修改为 slave1 和 slave2。
  • 配置 hosts 文件:

    • 在每台主机上修改 /etc/hosts 文件,将主机名映射到相应的 IP 地址。例如:
      192.168.1.10 master
      192.168.1.101 slave1
      192.168.1.102 slave2
      
  • SSH 无密码登录:

    • 在所有节点上配置 SSH 无密码登录,以便在集群中各个节点之间无缝切换。

2. 下载 Spark

  • 从 Apache Spark 官方网站下载最新版本的 Spark。例如,下载 Spark 3.5.1 版本:
    wget https://downloads.apache.org/spark/spark-3.5.1/spark-3.5.1-bin-hadoop3.tgz
    

3. 解压 Spark

  • 将下载的 Spark 安装包解压到指定目录,例如 /opt:
    sudo tar -xzvf spark-3.5.1-bin-hadoop3.tgz -C /opt
    

4. 配置环境变量

  • 编辑 ~/.bashrc 文件,添加以下内容:
    export SPARK_HOME=/opt/spark-3.5.1-bin-hadoop3
    export PATH=$SPARK_HOME/bin:$PATH
    export PYSPARK_PYTHON=/usr/bin/python3
    
  • 使配置生效:
    source ~/.bashrc
    

5. 修改 Spark 配置文件

  • 修改 spark-env.sh:

    • 进入 Spark 安装目录的 conf 文件夹:
      cd $SPARK_HOME/conf
      
    • 复制 spark-env.sh.template 为 spark-env.sh:
      cp spark-env.sh.template spark-env.sh
      
    • 编辑 spark-env.sh 文件,设置 Java、Scala、Hadoop 等环境变量:
      export JAVA_HOME=/usr/lib/jvm/java-8-openjdk-amd64
      export SCALA_HOME=/usr/share/scala
      export HADOOP_HOME=/usr/local/hadoop
      export HADOOP_CONF_DIR=$HADOOP_HOME/etc/hadoop
      export SPARK_MASTER_IP=192.168.1.10
      export SPARK_MASTER_PORT=7077
      export SPARK_MASTER_WEBUI_PORT=8099
      export SPARK_WORKER_CORES=3
      export SPARK_WORKER_INSTANCES=2
      export SPARK_WORKER_MEMORY=4G
      export SPARK_WORKER_WEBUI_PORT=8080
      export SPARK_EXECUTOR_CORES=2
      export SPARK_EXECUTOR_MEMORY=2G
      export LD_LIBRARY_PATH=$LD_LIBRARY_PATH:$HADOOP_HOME/lib/native
      
  • 修改 workers 文件:

    • 复制 workers.template 为 workers 文件。
    • 编辑 workers 文件,添加集群内其他服务器的 IP 地址或主机名,每行一个。例如:
      node01
      node02
      

6. 启动 Spark 集群

  • 在 master 节点上,启动集群:
    cd $SPARK_HOME/sbin
    ./start-master.sh
    ./start-slaves.sh
    

7. 验证安装

  • 在主节点上使用以下命令查看启动情况:
    jps
    
    • 应该能看到 Master 和 Worker 进程。
  • 在任意节点上启动 Spark Shell:
    $SPARK_HOME/bin/spark-shell
    
    • 如果出现 Scala 提示符,表示安装成功。

8. 访问 Spark Web 界面

  • 通过浏览器访问 Spark 的 Web 管理界面:
    http://192.168.1.10:8099
    
    • 这将显示 Spark 集群的当前概况。

通过以上步骤,你应该能够在 Linux 上成功安装和配置 Spark 集群。如果在安装过程中遇到任何问题,请检查环境变量配置是否正确,并确保所有依赖项都已正确安装。

向AI问一下细节

免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。

AI
助
手