Linux快速安装Spark
一 准备环境
java -version 检查)。如使用 PySpark,建议 Python 3.6+。如使用 HDFS/YARN 等 Hadoop 组件,再安装 Hadoop;仅本地测试可不装 Hadoop。二 下载与解压
wget https://downloads.apache.org/spark/spark-3.3.2/spark-3.3.2-bin-hadoop3.tgz
sudo tar -xzf spark-3.3.2-bin-hadoop3.tgz -C /opt
sudo ln -s /opt/spark-3.3.2-bin-hadoop3 /opt/spark # 可选:创建软链便于升级
三 配置环境变量
~/.bashrc 或 ~/.zshrc 中添加:export SPARK_HOME=/opt/spark
export PATH=$SPARK_HOME/bin:$PATH
# 可选:PySpark
export PYTHONPATH=$SPARK_HOME/python:$PYTHONPATH
# 可选:若系统未全局设置 JAVA_HOME
export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64 # 路径以实际为准
source ~/.bashrc(或 source ~/.zshrc)。四 快速验证与本地运行
spark-shell --version 或 pyspark --versionspark-shellpysparkfrom pyspark.sql import SparkSession
spark = SparkSession.builder.appName("QuickStart").getOrCreate()
df = spark.createDataFrame([("Java",20000),("Python",100000),("Scala",3000)], ["Lang","Users"])
df.show(); spark.stop()
spark-submit your_script.py(本地模式)。五 一键伪分布式与集群要点
$SPARK_HOME/conf/spark-env.sh:cp $SPARK_HOME/conf/spark-env.sh.template $SPARK_HOME/conf/spark-env.sh
# 在 spark-env.sh 中设置
export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64
export SPARK_MASTER_HOST=127.0.0.1
export SPARK_MASTER_PORT=7077
export SPARK_WORKER_CORES=2
export SPARK_WORKER_MEMORY=2g
$SPARK_HOME/sbin/start-master.sh 与 $SPARK_HOME/sbin/start-worker.sh spark://127.0.0.1:7077$SPARK_HOME/conf/slaves 中列出 Worker 主机名/IPSPARK_HOME 与环境变量$SPARK_HOME/sbin/start-all.shspark-submit --master spark://<Master-IP>:7077 your-app.jar(或 your_script.py)。免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。