有的,下面我给你一份Linux 下 Spark 安装教程(单机 / 伪分布式),适合学习和测试使用。
# Ubuntu / Debian
sudo apt update
sudo apt install openjdk-8-jdk -y
# CentOS
sudo yum install java-1.8.0-openjdk-devel -y
配置环境变量:
vim ~/.bashrc
添加:
export JAVA_HOME=/usr/lib/jvm/java-8-openjdk-amd64
export PATH=$JAVA_HOME/bin:$PATH
source ~/.bashrc
java -version
去官网选版本: https://spark.apache.org/downloads.html
例如(Hadoop 3 版本):
cd /opt
sudo wget https://archive.apache.org/dist/spark/spark-3.4.1/spark-3.4.1-bin-hadoop3.tgz
sudo tar -zxvf spark-3.4.1-bin-hadoop3.tgz
sudo mv spark-3.4.1-bin-hadoop3 spark
vim ~/.bashrc
添加:
export SPARK_HOME=/opt/spark
export PATH=$SPARK_HOME/bin:$SPARK_HOME/sbin:$PATH
source ~/.bashrc
spark-shell
出现 scala> 表示成功。
cd $SPARK_HOME/conf
cp spark-env.sh.template spark-env.sh
vim spark-env.sh
添加:
export JAVA_HOME=/usr/lib/jvm/java-8-openjdk-amd64
export SPARK_MASTER_HOST=localhost
$SPARK_HOME/sbin/start-all.sh
查看进程:
jps
应有:
Web UI:
http://localhost:8080
run-example SparkPi 10
或写个简单程序:
spark-shell
val data = 1 to 100
val rdd = sc.parallelize(data)
println(rdd.reduce(_ + _))
报错:
JAVA_HOME is not set
解决:在 spark-env.sh 中显式配置。
修改:
export SPARK_MASTER_WEBUI_PORT=8081
如果你已有 Hadoop:
export HADOOP_CONF_DIR=/etc/hadoop/conf
然后可用 YARN 模式:
spark-shell --master yarn
如果你愿意,我可以:
你用的是哪种 Linux?
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。