下面给你 Linux 上安装 Spark 的常用、可靠步骤,以 单机/本地模式(最常用) 为例,也包含 集群模式的简要说明。
Spark 依赖 Java,推荐:
# Ubuntu / Debian
sudo apt update
sudo apt install openjdk-11-jdk -y
# CentOS / Rocky / Alma
sudo yum install java-11-openjdk-devel -y
检查:
java -version
去官网:https://spark.apache.org/downloads.html
例如(Spark 3.5.x):
cd /opt
sudo wget https://archive.apache.org/dist/spark/spark-3.5.1/spark-3.5.1-bin-hadoop3.tgz
sudo tar -xzf spark-3.5.1-bin-hadoop3.tgz
sudo mv spark-3.5.1-bin-hadoop3 spark
sudo vim /etc/profile.d/spark.sh
写入:
export SPARK_HOME=/opt/spark
export PATH=$PATH:$SPARK_HOME/bin
生效:
source /etc/profile.d/spark.sh
验证:
spark-submit --version
spark-shell
看到 scala> 说明成功。
val data = Seq(1,2,3,4)
val rdd = sc.parallelize(data)
rdd.reduce(_ + _)
sudo apt install python3 python3-pip -y
pyspark
或写脚本:
from pyspark.sql import SparkSession
spark = SparkSession.builder.appName("test").getOrCreate()
df = spark.range(10)
df.show()
spark.stop()
如果你要 Standalone 集群:
# 主节点
$SPARK_HOME/sbin/start-master.sh
# 工作节点
$SPARK_HOME/sbin/start-worker.sh spark://master-ip:7077
| 问题 | 原因 |
|---|---|
| JAVA_HOME not set | 未配置 Java |
| Unsupported major.minor | Java 版本不对 |
| 端口占用 | 7077 / 8080 被占用 |
你可以告诉我:
我可以直接给你 一步一步可复制命令。
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。