1. 环境准备
在Linux系统上安装Spark前,需确保以下依赖已正确配置:
java -version命令验证,若未安装,使用系统包管理器安装(如Ubuntu/Debian执行sudo apt install openjdk-8-jdk,CentOS/RHEL执行sudo yum install java-1.8.0-openjdk)。HADOOP_HOME);仅本地测试可跳过。python3 --version验证,未安装时使用sudo yum install python3(CentOS)或sudo apt install python3(Ubuntu)安装。2. 下载Spark安装包
从Apache Spark官方网站下载最新稳定版本(如Spark 3.3.2),选择预编译的Hadoop版本(如spark-3.3.2-bin-hadoop3.tgz,适配Hadoop 3.x),使用wget命令下载至Linux服务器:
wget https://downloads.apache.org/spark/spark-3.3.2/spark-3.3.2-bin-hadoop3.tgz
3. 解压安装包
将下载的安装包解压至指定目录(如/opt,需管理员权限),并重命名文件夹以便管理:
sudo tar -xzf spark-3.3.2-bin-hadoop3.tgz -C /opt
sudo mv /opt/spark-3.3.2-bin-hadoop3 /opt/spark
4. 配置环境变量
编辑用户或系统的环境变量文件(如~/.bashrc或/etc/profile),添加Spark相关变量:
export SPARK_HOME=/opt/spark # Spark安装目录
export PATH=$SPARK_HOME/bin:$PATH # 将Spark命令加入PATH
保存后执行source ~/.bashrc(或source /etc/profile)使配置立即生效。
5. 配置Spark参数
进入Spark安装目录的conf子目录,完成以下配置:
spark-env.sh.template重命名为spark-env.sh(用于设置Spark环境变量):cd /opt/spark/conf
cp spark-env.sh.template spark-env.sh
spark-env.sh:添加Java路径(根据实际安装位置调整)、Master节点主机名(本地测试用localhost):export JAVA_HOME=/usr/lib/jvm/java-8-openjdk-amd64 # 替换为你的Java安装路径
export SPARK_MASTER_HOST=localhost
slaves.template重命名为slaves,并在文件中添加Worker节点的主机名(每行一个)。6. 验证安装
spark-shell命令,若出现Scala REPL界面(显示Spark context available as 'sc'),说明安装成功:$SPARK_HOME/bin/spark-shell
http://<your-server-ip>:8080(默认端口),若能看到Spark Master的Web界面(显示集群状态、Worker节点),则配置生效。7. 启动Spark集群(可选,Standalone模式)
$SPARK_HOME/sbin/start-master.sh
$SPARK_HOME/sbin/start-slave.sh spark://<master-ip>:7077
jps命令查看是否启动了Master和Worker进程。常见问题解决
Unsupported major.minor version错误,需安装JDK 8或11并更新JAVA_HOME。spark-env.sh中修改SPARK_MASTER_PORT(如export SPARK_MASTER_PORT=8081)。spark-defaults.conf中调整内存配置(如spark.executor.memory 1g、spark.driver.memory 1g)。免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。