在Linux系统上安装Apache Spark涉及多个步骤,以下是一个详细的安装过程解析:
检查Java环境:确保系统已经安装了Java环境,并且配置了JAVA_HOME环境变量。可以通过以下命令检查Java版本:
java -version
如果没有安装Java,需要从Oracle官网下载并安装JDK 1.8。
安装Scala:Spark需要Scala环境,确保已经安装Scala并配置了SCALA_HOME环境变量。可以从Scala官网下载适合的Scala版本。
从Apache Spark官网下载适合的版本。例如,下载Spark 3.5.2版本:
wget https://archive.apache.org/dist/spark/spark-3.5.2/spark-3.5.2-bin-hadoop3.2.tgz
将下载的Spark安装包解压到指定目录,例如 /opt:
sudo tar -xzvf spark-3.5.2-bin-hadoop3.2.tgz -C /opt
编辑环境变量文件:
编辑 /etc/profile 文件,添加以下内容:
export SPARK_HOME=/opt/spark-3.5.2-bin-hadoop3.2
export PATH=$PATH:$SPARK_HOME/bin:$SPARK_HOME/sbin
使配置生效:
source /etc/profile
配置 spark-env.sh:
进入Spark安装目录的 conf 文件夹:
cd /opt/spark-3.5.2/conf
复制 spark-env.sh.template 为 spark-env.sh:
cp spark-env.sh.template spark-env.sh
编辑 spark-env.sh 文件,设置Java、Scala、Hadoop等环境变量:
export JAVA_HOME=/usr/lib/jvm/java-8-openjdk-amd64
export SCALA_HOME=/usr/share/scala
export HADOOP_HOME=/usr/local/hadoop
export HADOOP_CONF_DIR=$HADOOP_HOME/etc/hadoop
export SPARK_MASTER_IP=192.168.199.132
export SPARK_WORKER_MEMORY=512M
配置 slaves 文件:
复制 slaves.template 为 slaves 文件。
编辑 slaves 文件,添加集群内其他服务器的IP地址或主机名,每行一个。
分发配置文件到集群各节点:
scp -r /opt/spark-3.5.2/conf/* slave_node1:/usr/local/spark/conf/
scp -r /opt/spark-3.5.2/conf/* slave_node2:/usr/local/spark/conf/
重复以上命令,将所有配置文件分发到所有节点。
启动Spark集群:
进入Spark的 sbin 目录:
cd /opt/spark-3.5.2/sbin
启动Spark集群:
./start-all.sh
检查Spark状态:
使用以下命令检查Spark Master和Worker是否启动成功:
jps
访问Spark的Web UI:
通常在 http://<master-ip>:8080,查看集群状态和运行信息。
运行示例:
进入Spark shell进行交互式操作:
./bin/spark-shell
运行一个简单的Spark示例,例如计算π值:
./bin/run-example SparkPi
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。