以下是在Linux部署Spark的步骤(以Standalone模式为例):
环境准备
sudo apt install openjdk-8-jdk(Ubuntu/Debian)或 sudo yum install java-1.8.0-openjdk(CentOS/RHEL)。systemctl stop firewalld && systemctl disable firewalld。下载与解压Spark
spark-3.5.0-bin-hadoop3.tgz),解压至指定目录(如/opt):wget https://downloads.apache.org/spark/spark-3.5.0/spark-3.5.0-bin-hadoop3.tgztar -zxvf spark-3.5.0-bin-hadoop3.tgz -C /opt。配置环境变量
~/.bashrc或/etc/profile,添加:export SPARK_HOME=/opt/spark-3.5.0-bin-hadoop3export PATH=$SPARK_HOME/bin:$PATHsource ~/.bashrc使配置生效。配置集群参数
$SPARK_HOME/conf/spark-env.sh(需先复制模板文件):export JAVA_HOME=/usr/lib/jvm/java-11-openjdk # 替换为实际路径
export SPARK_MASTER_IP=master-node-ip # 主节点IP
export SPARK_WORKER_MEMORY=2g # 从节点内存(按需调整)
```。
$SPARK_HOME/conf/slaves文件,添加从节点主机名/IP(每行一个)。启动集群
$SPARK_HOME/sbin/start-master.sh。$SPARK_HOME/sbin/start-slaves.sh 或在主节点执行start-slave.sh spark://master-ip:7077。验证部署
http://master-ip:8080,查看Worker节点是否在线。spark-shell或spark-submit测试任务提交。说明:
slaves文件,直接在单节点启动Master和Worker。参考来源:
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。