下面给你一份 在 Linux 上安装与配置 Apache Spark 的完整入门指南。以 Spark 3.x + Hadoop 3.x + Linux(CentOS / Ubuntu 通用) 为例,适合学习和单机/伪分布式使用。
java -version
若未安装:
Ubuntu
sudo apt update
sudo apt install openjdk-8-jdk
CentOS
sudo yum install java-1.8.0-openjdk java-1.8.0-openjdk-devel
设置环境变量:
export JAVA_HOME=/usr/lib/jvm/java-1.8.0-openjdk
官网:https://spark.apache.org/downloads.html
示例(Spark 3.5.0 + Hadoop 3):
wget https://downloads.apache.org/spark/spark-3.5.0/spark-3.5.0-bin-hadoop3.tgz
tar -zxvf spark-3.5.0-bin-hadoop3.tgz
mv spark-3.5.0-bin-hadoop3 /usr/local/spark
编辑 ~/.bashrc 或 ~/.bash_profile:
export SPARK_HOME=/usr/local/spark
export PATH=$SPARK_HOME/bin:$SPARK_HOME/sbin:$PATH
生效:
source ~/.bashrc
cd $SPARK_HOME/conf
cp spark-env.sh.template spark-env.sh
cp slaves.template slaves # 单机可跳过
spark-env.shexport JAVA_HOME=/usr/lib/jvm/java-1.8.0-openjdk
export SPARK_MASTER_HOST=localhost
export SPARK_WORKER_MEMORY=2g
export SPARK_WORKER_CORES=2
spark-shell
或运行 Python:
pyspark
$SPARK_HOME/sbin/start-master.sh
$SPARK_HOME/sbin/start-worker.sh spark://localhost:7077
Web UI:
http://localhost:8080
停止:
$SPARK_HOME/sbin/stop-all.sh
run-example SparkPi 10
spark-submit --version
spark-submit \
--master local[*] \
--class org.apache.spark.examples.SparkPi \
$SPARK_HOME/examples/jars/spark-examples_2.12-3.5.0.jar \
100
echo $JAVA_HOME
如为空,说明 Java 环境变量未配置。
netstat -tunlp | grep 7077
减少 worker 内存:
export SPARK_WORKER_MEMORY=1g
| 模式 | 说明 | 命令 |
|---|---|---|
| local | 本地单线程 | local |
| local[N] | 本地多线程 | local[4] |
| standalone | 自带集群 | spark://host:7077 |
| YARN | Hadoop 集群 | yarn |
如果你需要:
可以直接告诉我你的使用场景(学习 / 工作 / 集群规模)。
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。