在Ubuntu系统上安装Apache Spark的步骤如下:
sudo apt update
sudo apt install openjdk-8-jdk
安装完成后,验证Java版本:java -version
sudo apt update
sudo apt upgrade
sudo apt install openjdk-8-jdk
验证Java安装:
java -version
从Apache Spark官方网站下载适合Ubuntu的Spark安装包。以下是一个示例命令,下载Spark 2.4.4版本:
wget https://downloads.apache.org/spark/spark-2.4.4/spark-2.4.4-bin-hadoop2.7.tgz
请根据您的系统环境和需求选择合适的Spark版本。
将下载的Spark安装包解压到/opt目录下:
sudo tar -xvf spark-2.4.4-bin-hadoop2.7.tgz -C /opt
编辑~/.bashrc文件,添加以下行:
export SPARK_HOME=/opt/spark-2.4.4-bin-hadoop2.7
export PATH=$PATH:$SPARK_HOME/bin:$SPARK_HOME/sbin
然后,使环境变量生效:
source ~/.bashrc
在终端中运行以下命令来启动Spark Master:
start-master.sh
然后,使用以下命令启动Spark Shell:
spark-shell
在Spark Shell中,您可以执行以下示例代码来测试Spark是否安装成功:
val data = Seq(1, 2, 3, 4, 5)
val rdd = sc.parallelize(data)
println(rdd.reduce(_ + _))
如果一切正常,您应该会看到输出结果15。
配置spark-env.sh:
进入$SPARK_HOME/conf目录,复制spark-env.sh.template文件为spark-env.sh,并编辑该文件:
cp $SPARK_HOME/conf/spark-env.sh.template $SPARK_HOME/conf/spark-env.sh
nano $SPARK_HOME/conf/spark-env.sh
在文件中添加以下内容(根据您的系统环境进行调整):
export SPARK_MASTER_HOST="localhost"
export SPARK_MASTER_PORT="7077"
export SPARK_WORKER_MEMORY="2g"
export SPARK_WORKER_CORES="2"
配置slaves:
在$SPARK_HOME/conf目录下,复制slaves.template文件为slaves,并根据您的集群配置添加节点信息:
cp $SPARK_HOME/conf/slaves.template slaves
启动Spark集群:
sudo apt install zookeeper
sudo /opt/zookeeper/bin/zkServer.sh start
spark-submit --class org.apache.spark.deploy.history.HistoryServer --master spark://localhost:7077 --port 18080 $SPARK_HOME/lib/spark-history_2.11-3.1.1.jar
start-yarn.sh
通过以上步骤,您已经成功在Ubuntu系统上安装并配置了Apache Spark。接下来,您可以开始使用Spark进行大数据处理和分析。
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。