下面给你几种在 Linux 系统上快速安装 Apache Spark 的常用方法,从「最快上手」到「更规范的生产方式」都有,你可以按需求选择。
Spark 依赖 Java,先确认 Java 已安装:
java -version
如果没有安装(以 Java 8 或 11 为例):
# Ubuntu / Debian
sudo apt update
sudo apt install openjdk-11-jdk -y
# CentOS / Rocky / Alma
sudo yum install java-11-openjdk-devel -y
去官网复制最新版本地址(示例为 3.5.1):
wget https://downloads.apache.org/spark/spark-3.5.1/spark-3.5.1-bin-hadoop3.tgz
tar -zxvf spark-3.5.1-bin-hadoop3.tgz
sudo mv spark-3.5.1-bin-hadoop3 /opt/spark
配置环境变量:
echo 'export SPARK_HOME=/opt/spark' >> ~/.bashrc
echo 'export PATH=$SPARK_HOME/bin:$PATH' >> ~/.bashrc
source ~/.bashrc
spark-shell
出现 Spark 交互式界面即成功 ✅
$SPARK_HOME/sbin/start-master.sh
$SPARK_HOME/sbin/start-worker.sh spark://$(hostname):7077
访问 Web UI:
http://localhost:8080
如果你主要用 PySpark,这是最简单的方式之一:
conda create -n spark_env python=3.10 -y
conda activate spark_env
conda install -c conda-forge pyspark -y
直接运行:
pyspark
✅ 无需单独安装 Spark
✅ 自动适配 Java 和 Hadoop
适合测试 / 快速体验
docker run -it bitnami/spark:latest bash
或直接启动 PySpark:
docker run -it bitnami/spark pyspark
| 场景 | 推荐方式 |
|---|---|
| 学习 / 本地开发 | 直接解压 / Conda |
| 单机集群 | Spark Standalone |
| 企业生产 | YARN / Kubernetes |
| 云环境 | EMR / Dataproc / Cloud Spark |
export JAVA_HOME=$(dirname $(dirname $(readlink -f $(which java))))
netstat -tunlp | grep 7077
你可以告诉我:
我可以给你一份完全定制化的 Spark 安装方案。
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。