在 CentOS 上安装 Apache Spark 可以按照以下步骤进行。以下指南适用于 CentOS 7 和 CentOS 8。
sudo 权限的用户进行安装。首先,确保系统软件包是最新的:
sudo yum update -y
Spark 需要 Java 环境,推荐使用 OpenJDK:
# 安装 OpenJDK 8
sudo yum install -y java-1.8.0-openjdk-devel
# 验证 Java 安装
java -version
如果需要使用 OpenJDK 11,可以使用以下命令:
sudo yum install -y java-11-openjdk-devel
# 验证 Java 安装
java -version
下载 Spark
前往 Apache Spark 下载页面 获取最新版本的下载链接。以下示例使用 Spark 3.4.1:
wget https://www.apache.org/dyn/closer.cgi/spark/spark-3.4.1/spark-3.4.1-bin-hadoop3.2.tgz
注意:请根据实际需要下载对应版本的 Spark,并调整下载链接中的版本号和 Hadoop 版本兼容性。
解压 Spark
sudo tar -xzvf spark-3.4.1-bin-hadoop3.2.tgz -C /opt
重命名解压后的目录(可选)
sudo mv /opt/spark-3.4.1-bin-hadoop3.2 /opt/spark
为了让 Spark 在终端中可用,需要配置环境变量:
编辑 ~/.bash_profile 或 ~/.bashrc
nano ~/.bash_profile
添加以下内容
export SPARK_HOME=/opt/spark
export PATH=$PATH:$SPARK_HOME/bin:$SPARK_HOME/sbin
使配置生效
source ~/.bash_profile
验证配置
spark-submit --version
应该显示 Spark 的版本信息。
根据需求,可以对 Spark 进行一些基本配置,例如设置内存、核心数等。
编辑 spark-defaults.conf
nano $SPARK_HOME/conf/spark-defaults.conf
添加或修改配置项
例如,设置 Master 为本地模式:
spark.master local[*]
根据需要添加其他配置项。
Spark 提供了多种启动方式,常用的有:
Standalone 模式(本地模式)
在 spark-defaults.conf 中设置 spark.master 为 local[*] 后,可以使用以下命令启动 Spark:
spark-shell
这将启动 Spark 的交互式 Shell。
集群模式
如果需要在集群上运行 Spark,需要配置 spark-env.sh 和 slaves 文件,并使用 start-master.sh 和 start-worker.sh 启动集群。
注意:集群模式的配置较为复杂,建议参考 官方文档 进行详细配置。
启动 spark-shell 后,可以运行一个简单的 Spark 程序来验证安装是否成功:
val textFile = spark.read.text("path/to/your/textfile.txt")
textFile.show()
确保替换 path/to/your/textfile.txt 为实际文件路径。
如果需要在集群节点之间通信,可能需要配置防火墙:
sudo firewall-cmd --permanent --zone=public --add-port=7077/tcp
sudo firewall-cmd --permanent --zone=public --add-port=8080/tcp
sudo firewall-cmd --reload
以上步骤涵盖了在 CentOS 上安装 Apache Spark 的基本流程。根据具体需求,可能需要进行额外的配置和优化。建议参考 Apache Spark 官方文档 获取更详细的信息和高级配置指南。
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。