在Linux系统安装Spark步骤如下:
环境准备
sudo apt-get install openjdk-8-jdk(Ubuntu)或 sudo yum install java-11-openjdk(CentOS)。sudo apt-get install python3。下载Spark
从官网获取最新版本,如:
wget https://downloads.apache.org/spark/spark-3.3.2/spark-3.3.2-bin-hadoop3.tgz。
解压与目录配置
tar -xzf spark-*.tgz -C /opt,并重命名目录(可选):mv spark-* spark。
配置环境变量
编辑~/.bashrc或~/.zshrc,添加:
export SPARK_HOME=/opt/spark
export PATH=$SPARK_HOME/bin:$PATH
export PYTHONPATH=$SPARK_HOME/python:$PYTHONPATH # 若需PySpark
执行source ~/.bashrc使配置生效。
验证安装
运行spark-shell(Scala)或pyspark(Python),若出现交互式界面则安装成功。
集群模式(可选)
spark-env.sh(设置SPARK_MASTER_HOST等)和slaves文件(添加节点IP)。./sbin/start-master.sh + ./sbin/start-worker.sh spark://master-ip:7077。注意事项
spark-*.bin-hadoop*.tgz包。参考来源:
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。