在 Linux 上安装和运行 Apache Spark,需要准备以下几类配置和环境。下面按“必须 / 推荐 / 可选”给你梳理清楚。
Spark 依赖 JVM:
安装示例(Ubuntu):
sudo apt install openjdk-11-jdk
配置 JAVA_HOME:
export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64
export PATH=$JAVA_HOME/bin:$PATH
解压即可,无需编译:
tar -xzf spark-3.5.1-bin-hadoop3.tgz
mv spark-3.5.1-bin-hadoop3 /opt/spark
export SPARK_HOME=/opt/spark
export PATH=$SPARK_HOME/bin:$PATH
✅ 不需要额外组件
直接运行:
spark-shell
或
pyspark
需要配置:
$SPARK_HOME/conf/spark-env.sh
示例:
export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64
export SPARK_MASTER_HOST=192.168.1.10
export SPARK_WORKER_CORES=4
export SPARK_WORKER_MEMORY=8g
slaves 文件(旧版本):
worker1
worker2
需要:
HADOOP_CONF_DIR 指向 Hadoop 配置目录export HADOOP_CONF_DIR=/etc/hadoop/conf
提交示例:
spark-submit --master yarn ...
需要:
kubectl 可用ulimit -n 65536
swapoff -a
需要:
pip install pyspark
或系统 Python ≥ 3.7
✅ 必须:
✅ 生产额外:
如果你愿意,可以告诉我:
我可以直接给你一套对应场景的安装步骤。
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。