下面以 Linux(Ubuntu / CentOS 等) 为例,说明 Apache Spark 安装步骤(单机 / 伪分布式模式,最适合学习和开发)。
Spark 依赖 Java 8 / 11 / 17(推荐 Java 8 或 11)
sudo apt update
sudo apt install openjdk-8-jdk -y
sudo yum install java-1.8.0-openjdk-devel -y
验证:
java -version
编辑环境变量:
vim ~/.bashrc
添加:
export JAVA_HOME=/usr/lib/jvm/java-8-openjdk-amd64
export PATH=$JAVA_HOME/bin:$PATH
使配置生效:
source ~/.bashrc
验证:
echo $JAVA_HOME
进入官网:https://spark.apache.org/downloads.html
示例(Spark 3.5.0 + Hadoop 3):
wget https://downloads.apache.org/spark/spark-3.5.0/spark-3.5.0-bin-hadoop3.tgz
tar -zxvf spark-3.5.0-bin-hadoop3.tgz
sudo mv spark-3.5.0-bin-hadoop3 /usr/local/spark
vim ~/.bashrc
添加:
export SPARK_HOME=/usr/local/spark
export PATH=$SPARK_HOME/bin:$SPARK_HOME/sbin:$PATH
生效:
source ~/.bashrc
spark-shell
成功后会看到:
Spark context available as 'sc'
Spark session available as 'spark'
退出:
:quit
pyspark
$SPARK_HOME/bin/run-example SparkPi
或:
spark-submit --class org.apache.spark.examples.SparkPi \
$SPARK_HOME/examples/jars/spark-examples_2.12-3.5.0.jar
cd $SPARK_HOME/conf
cp slaves.template slaves
编辑 slaves:
localhost
start-master.sh
start-worker.sh spark://localhost:7077
访问 Web UI:
http://localhost:8080
java -version
echo $JAVA_HOME
netstat -tunlp | grep 8080
# 1. 安装 Java
sudo apt install openjdk-8-jdk
# 2. 下载解压 Spark
wget spark-xxx.tgz
tar -zxvf spark-xxx.tgz
mv spark-xxx /usr/local/spark
# 3. 配置环境变量
export SPARK_HOME=/usr/local/spark
export PATH=$SPARK_HOME/bin:$PATH
# 4. 验证
spark-shell
如果你需要:
可以告诉我你的 Linux 版本 + 使用场景,我可以给你定制方案。
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。