下面按**“安装后怎么跑起来 → 怎么写程序 → 常用命令/注意事项”**的顺序,给你一个 Linux 上 Spark 的实用入门指南(以 Spark on Linux(单机 / 伪分布式) 为主)。
假设你已经下载并解压了 Spark(如 spark-3.5.1-bin-hadoop3):
cd ~/spark-3.5.1-bin-hadoop3
检查版本:
./bin/spark-submit --version
能看到版本信息,说明安装 OK。
./bin/spark-shell
进入后直接写代码:
val data = Seq(1,2,3,4)
val rdd = sc.parallelize(data)
rdd.reduce(_ + _)
./bin/pyspark
data = [1,2,3,4]
rdd = sc.parallelize(data)
rdd.reduce(lambda x,y: x+y)
./bin/spark-submit my_app.py
my_app.py 示例:
from pyspark.sql import SparkSession
spark = SparkSession.builder.appName("demo").getOrCreate()
df = spark.range(10)
df.show()
spark.stop()
./bin/spark-submit \
--class com.example.Main \
my-app.jar
./bin/pyspark --master local[4]
local[4]表示用 4 个线程
./bin/pyspark --master spark://master:7077
需要先启动:
./sbin/start-master.sh
./sbin/start-worker.sh spark://localhost:7077
Web UI:
http://localhost:8080
df = spark.read.csv("data.csv", header=True)
df.show()
df.write.mode("overwrite").parquet("output/")
vim ~/.bashrc
添加:
export SPARK_HOME=~/spark-3.5.1-bin-hadoop3
export PATH=$SPARK_HOME/bin:$PATH
生效:
source ~/.bashrc
之后可以直接:
pyspark
spark-submit app.py
java -version
没有就装:
sudo apt install openjdk-11-jdk
推荐 Python 3.8–3.10
./bin/pyspark --conf spark.driver.memory=2g
如果你愿意,可以告诉我:
我可以直接给你可运行示例 + 部署方案。
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。