一、环境准备
java -version命令检查是否已安装;若未安装,可从Oracle官网下载对应版本并配置JAVA_HOME环境变量(如export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64),确保java和javac命令可用。HADOOP_HOME(如export HADOOP_HOME=/opt/hadoop-3.3.6)及HADOOP_CONF_DIR(指向Hadoop配置文件目录)。本地测试可跳过此步。python3 --version检查。二、下载Spark
从Apache Spark官方网站下载最新稳定版本(如3.3.2),选择预编译的Hadoop版本(如spark-3.3.2-bin-hadoop3.tgz,适配Hadoop 3.x),使用wget命令下载到Linux服务器:
wget https://downloads.apache.org/spark/spark-3.3.2/spark-3.3.2-bin-hadoop3.tgz。
三、解压安装包
使用tar命令将下载的压缩包解压到目标目录(如/opt,需管理员权限):
sudo tar -xzf spark-3.3.2-bin-hadoop3.tgz -C /opt
解压后得到目录/opt/spark-3.3.2-bin-hadoop3(后续操作均基于此目录)。
四、配置环境变量
~/.bashrc或~/.zshrc),添加以下内容:export SPARK_HOME=/opt/spark-3.3.2-bin-hadoop3 # Spark安装目录
export PATH=$SPARK_HOME/bin:$PATH # 将Spark命令加入PATH
/etc/profile文件,添加相同内容。source ~/.bashrc(或对应配置文件)使环境变量立即生效。五、验证安装
运行spark-shell命令启动Spark的Scala交互式Shell:
spark-shell
若安装成功,终端将显示Spark版本信息及REPL(Read-Eval-Print Loop)界面(如Spark context available as 'sc');输入:quit可退出。
六、启动Spark集群(可选,分布式模式) 若需部署为集群,需完成以下步骤:
$SPARK_HOME/conf目录,复制spark-env.sh.template为spark-env.sh,编辑并添加:export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64 # Java路径
export SPARK_MASTER_HOST=<master-ip> # Master节点IP
export SPARK_WORKER_CORES=2 # Worker节点CPU核心数
export SPARK_WORKER_MEMORY=2g # Worker节点内存
slaves.template为slaves,添加Worker节点IP(每行一个,如worker1-ip、worker2-ip)。start-dfs.sh启动HDFS,执行start-yarn.sh启动YARN。$SPARK_HOME/sbin/start-all.sh,启动Master和所有Worker节点。http://<master-ip>:8080(默认端口8080),查看集群状态(如Master节点、Worker节点列表)。七、提交Spark应用(可选)
使用spark-submit命令提交Spark作业(以官方SparkPi示例为例):
$SPARK_HOME/bin/spark-submit \
--class org.apache.spark.examples.SparkPi \ # 主类
--master yarn \ # 集群模式(yarn/standalone)
--deploy-mode cluster \ # 部署模式(cluster/client)
$SPARK_HOME/examples/jars/spark-examples_2.12-3.3.2.jar # 应用JAR包
提交后,可通过Web界面查看应用运行状态(如进度、日志)。
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。