在Linux系统上部署Apache Spark涉及几个基本步骤,以下是一个详细的指南:
安装Java环境:
java -version。sudo apt update
sudo apt install openjdk-11-jdk
下载Spark:
wget https://dlcdn.apache.org/spark/spark-3.5.4/spark-3.5.4-bin-hadoop3.tgz
解压文件:
tar命令解压缩已下载的Spark安装包到指定目录,例如 /opt:sudo tar -xzvf spark-3.5.4-bin-hadoop3.tgz -C /opt
.bashrc 或者全局的 /etc/profile 文件来设置 SPARK_HOME 和 PATH 变量。.bashrc 文件:vi ~/.bashrc
export SPARK_HOME=/opt/spark-3.5.4-bin-hadoop3
export PATH=$SPARK_HOME/bin:$PATH
source ~/.bashrc
修改配置文件:
cd $SPARK_HOME/conf
sudo cp spark-env.sh.template spark-env.sh
sudo cp spark-defaults.conf.template spark-defaults.conf
配置 spark-env.sh:
spark-env.sh,添加以下内容:export JAVA_HOME=/usr/lib/jvm/java-8-openjdk-amd64
export HADOOP_CONF_DIR=/opt/hadoop/etc/hadoop
export LD_LIBRARY_PATH=/opt/hadoop/lib/native
export SPARK_LOCAL_IP=localhost
启动 Spark Master 和 Worker:
$SPARK_HOME/sbin/start-master.sh
$SPARK_HOME/sbin/start-slave.sh spark://<master-ip>:7077
访问Spark Web界面:
http://<master-ip>:8080
运行Spark Shell:
spark-shell:$SPARK_HOME/bin/spark-shell
通过以上步骤,你应该能够在Linux系统上成功安装和运行Apache Spark。如果在配置过程中遇到任何问题,可以参考Spark官方文档或相关社区资源。
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。