温馨提示×

温馨提示×

您好,登录后才能下订单哦!

密码登录×
登录注册×
其他方式登录
点击 登录注册 即表示同意《亿速云用户服务条款》

Spark 安装在 Linux 上的流程

发布时间:2025-10-04 15:39:59 来源:亿速云 阅读:126 作者:小樊 栏目:系统运维

一、环境准备

  1. 安装Java(必选):Spark依赖Java环境,推荐使用JDK 8或JDK 11。通过java -version命令检查是否已安装;若未安装,可从Oracle官网下载对应版本并配置JAVA_HOME环境变量(如export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64),确保javajavac命令可用。
  2. 安装Hadoop(可选):若需使用HDFS、YARN等Hadoop组件,需提前安装Hadoop并配置HADOOP_HOME(如export HADOOP_HOME=/opt/hadoop-3.3.6)及HADOOP_CONF_DIR(指向Hadoop配置文件目录)。本地测试可跳过此步。
  3. 安装Python(可选):若需使用PySpark(Spark的Python API),需安装Python 3.6及以上版本(推荐Python 3.8+),可通过python3 --version检查。

二、下载Spark 从Apache Spark官方网站下载最新稳定版本(如3.3.2),选择预编译的Hadoop版本(如spark-3.3.2-bin-hadoop3.tgz,适配Hadoop 3.x),使用wget命令下载到Linux服务器
wget https://downloads.apache.org/spark/spark-3.3.2/spark-3.3.2-bin-hadoop3.tgz

三、解压安装包 使用tar命令将下载的压缩包解压到目标目录(如/opt,需管理员权限):
sudo tar -xzf spark-3.3.2-bin-hadoop3.tgz -C /opt
解压后得到目录/opt/spark-3.3.2-bin-hadoop3(后续操作均基于此目录)。

四、配置环境变量

  1. 编辑用户级配置文件(如~/.bashrc~/.zshrc),添加以下内容:
    export SPARK_HOME=/opt/spark-3.3.2-bin-hadoop3  # Spark安装目录
    export PATH=$SPARK_HOME/bin:$PATH              # 将Spark命令加入PATH
    
  2. 若需全局生效(所有用户可用),可编辑/etc/profile文件,添加相同内容。
  3. 执行source ~/.bashrc(或对应配置文件)使环境变量立即生效。

五、验证安装 运行spark-shell命令启动Spark的Scala交互式Shell:
spark-shell
若安装成功,终端将显示Spark版本信息及REPL(Read-Eval-Print Loop)界面(如Spark context available as 'sc');输入:quit可退出。

六、启动Spark集群(可选,分布式模式) 若需部署为集群,需完成以下步骤:

  1. 配置Spark集群参数
    • 进入$SPARK_HOME/conf目录,复制spark-env.sh.templatespark-env.sh,编辑并添加:
      export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64  # Java路径
      export SPARK_MASTER_HOST=<master-ip>               # Master节点IP
      export SPARK_WORKER_CORES=2                        # Worker节点CPU核心数
      export SPARK_WORKER_MEMORY=2g                      # Worker节点内存
      
    • 复制slaves.templateslaves,添加Worker节点IP(每行一个,如worker1-ipworker2-ip)。
  2. 启动Hadoop集群(若使用HDFS/YARN)
    在Hadoop Master节点执行start-dfs.sh启动HDFS,执行start-yarn.sh启动YARN。
  3. 启动Spark集群
    在Spark Master节点执行$SPARK_HOME/sbin/start-all.sh,启动Master和所有Worker节点。
  4. 访问Web界面
    打开浏览器,输入http://<master-ip>:8080(默认端口8080),查看集群状态(如Master节点、Worker节点列表)。

七、提交Spark应用(可选) 使用spark-submit命令提交Spark作业(以官方SparkPi示例为例):

$SPARK_HOME/bin/spark-submit \
  --class org.apache.spark.examples.SparkPi \        # 主类
  --master yarn \                                  # 集群模式(yarn/standalone)
  --deploy-mode cluster \                          # 部署模式(cluster/client)
  $SPARK_HOME/examples/jars/spark-examples_2.12-3.3.2.jar  # 应用JAR包

提交后,可通过Web界面查看应用运行状态(如进度、日志)。

向AI问一下细节

免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。

AI