Linux下Apache Spark安装步骤
一 环境准备
java -version 检查版本;未安装可用包管理器安装,例如在 Debian/Ubuntu 上:sudo apt update && sudo apt install openjdk-11-jdk;在 RHEL/CentOS 上:sudo yum install java-11-openjdk-devel。HADOOP_CONF_DIR 指向正确的配置目录。二 下载与解压
wget https://downloads.apache.org/spark/spark-3.3.2/spark-3.3.2-bin-hadoop3.tgzsudo tar -xzf spark-3.3.2-bin-hadoop3.tgz -C /optsudo ln -sfn /opt/spark-3.3.2-bin-hadoop3 /opt/spark三 配置环境变量
nano ~/.bashrc(或 ~/.zshrc),加入:
export SPARK_HOME=/opt/sparkexport PATH=$SPARK_HOME/bin:$SPARK_HOME/sbin:$PATHsource ~/.bashrc/etc/profile 并执行 source /etc/profile。四 本地验证
spark-shell(Scala)。看到 Scala REPL 即表示安装成功。pyspark(确保已安装 Python 3)。val data = Seq(1,2,3,4,5); val rdd = sc.parallelize(data); println(rdd.sum())rdd = sc.parallelize([1,2,3,4,5]); print(rdd.sum())五 集群部署与常用端口
$SPARK_HOME/conf/spark-env.sh:
export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64(按实际路径)export SPARK_MASTER_HOST=your-master-host(主机名或 IP)export HADOOP_HOME=/opt/hadoopexport HADOOP_CONF_DIR=$HADOOP_HOME/etc/hadoopexport SPARK_DIST_CLASSPATH=$($HADOOP_HOME/bin/hadoop classpath)$SPARK_HOME/conf/slaves:每行一个 Worker 主机名或 IP。start-all.sh(或分别执行 start-master.sh 与 start-workers.sh)。http://<master>:8080,查看 Workers 与 Applications。spark-submit --master spark://<master>:7077 your-app.jar。spark-env.sh 设置 SPARK_MASTER_WEBUI_PORT)start-all.sh 冲突,建议仅保留一套脚本,或将其中一组重命名以避免路径优先顺序导致误调用。spark-defaults.conf 开启事件日志:
spark.eventLog.enabled truespark.eventLog.dir hdfs://<namenode>:9000/spark-eventlog(需提前在 HDFS 创建目录)spark-env.sh 配置 History Server:
export SPARK_HISTORY_OPTS="-Dspark.history.ui.port=18080 -Dspark.history.retainedApplications=30 -Dspark.history.fs.logDirectory=hdfs://<namenode>:9000/spark-eventlog"$SPARK_HOME/sbin/start-history-server.sh,访问 http://<host>:18080。免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。