在 Linux 上高效安装 Apache Spark,关键是根据你的使用场景(单机开发 / 集群 / 结合 Hadoop)选择最简路径。下面按推荐程度给你一套清晰、可复用的方案。
适合:学习、开发、调试、PySpark、本地测试
sudo apt update
sudo apt install -y openjdk-11-jdk wget curl
检查 Java:
java -version
wget https://downloads.apache.org/spark/spark-3.5.1/spark-3.5.1-bin-hadoop3.tgz
解压:
tar -xvf spark-3.5.1-bin-hadoop3.tgz
mv spark-3.5.1-bin-hadoop3 ~/spark
编辑 ~/.bashrc:
export SPARK_HOME=~/spark
export PATH=$SPARK_HOME/bin:$SPARK_HOME/sbin:$PATH
生效:
source ~/.bashrc
spark-shell
或:
pyspark
✅ 成功即完成安装(无需 Hadoop)
cd ~/spark
./sbin/start-master.sh
访问 Web UI:
http://<master-ip>:8080
./sbin/start-worker.sh spark://master-ip:7077
spark-submit \
--master spark://master-ip:7077 \
your_app.py
✅ 适合中小规模集群
✅ 直接使用 Spark 官方预编译的 Hadoop 版本
spark-3.5.1-bin-hadoop3.tgz
无需单独安装 Hadoop,只要:
HADOOP_CONF_DIR 正确export HADOOP_CONF_DIR=/etc/hadoop/conf
适合:数据科学家、PySpark、Jupyter
conda create -n spark_env python=3.10
conda activate spark_env
conda install -c conda-forge pyspark
直接运行:
pyspark
✅ 自动处理依赖,最省事
spark-env.shexport JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64
| 场景 | 推荐方式 |
|---|---|
| 学习 / 本地开发 | 官方 TGZ |
| PySpark + Jupyter | Conda |
| 小型集群 | Spark Standalone |
| 大数据生产 | YARN / Kubernetes |
| 云环境 | Databricks / EMR |
你可以直接告诉我:
我可以直接给你优化后的 spark-defaults.conf 配置。
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。