在 Linux 上安装 Spark 集群可以分为几个步骤,以下是详细的指南:
安装 Java:
java -version
sudo apt-get update
sudo apt-get install openjdk-8-jdk
修改主机名:
master,在 slave 节点上分别修改为 slave1 和 slave2。配置 hosts 文件:
/etc/hosts 文件,将主机名映射到相应的 IP 地址。例如:192.168.1.10 master
192.168.1.101 slave1
192.168.1.102 slave2
SSH 无密码登录:
wget https://downloads.apache.org/spark/spark-3.5.1/spark-3.5.1-bin-hadoop3.tgz
/opt:sudo tar -xzvf spark-3.5.1-bin-hadoop3.tgz -C /opt
~/.bashrc 文件,添加以下内容:export SPARK_HOME=/opt/spark-3.5.1-bin-hadoop3
export PATH=$SPARK_HOME/bin:$PATH
export PYSPARK_PYTHON=/usr/bin/python3
source ~/.bashrc
修改 spark-env.sh:
conf 文件夹:cd $SPARK_HOME/conf
spark-env.sh.template 为 spark-env.sh:cp spark-env.sh.template spark-env.sh
spark-env.sh 文件,设置 Java、Scala、Hadoop 等环境变量:export JAVA_HOME=/usr/lib/jvm/java-8-openjdk-amd64
export SCALA_HOME=/usr/share/scala
export HADOOP_HOME=/usr/local/hadoop
export HADOOP_CONF_DIR=$HADOOP_HOME/etc/hadoop
export SPARK_MASTER_IP=192.168.1.10
export SPARK_MASTER_PORT=7077
export SPARK_MASTER_WEBUI_PORT=8099
export SPARK_WORKER_CORES=3
export SPARK_WORKER_INSTANCES=2
export SPARK_WORKER_MEMORY=4G
export SPARK_WORKER_WEBUI_PORT=8080
export SPARK_EXECUTOR_CORES=2
export SPARK_EXECUTOR_MEMORY=2G
export LD_LIBRARY_PATH=$LD_LIBRARY_PATH:$HADOOP_HOME/lib/native
修改 workers 文件:
workers.template 为 workers 文件。workers 文件,添加集群内其他服务器的 IP 地址或主机名,每行一个。例如:node01
node02
cd $SPARK_HOME/sbin
./start-master.sh
./start-slaves.sh
jps
$SPARK_HOME/bin/spark-shell
http://192.168.1.10:8099
通过以上步骤,你应该能够在 Linux 上成功安装和配置 Spark 集群。如果在安装过程中遇到任何问题,请检查环境变量配置是否正确,并确保所有依赖项都已正确安装。
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。