温馨提示×

温馨提示×

您好,登录后才能下订单哦!

密码登录×
登录注册×
其他方式登录
点击 登录注册 即表示同意《亿速云用户服务条款》

linux spark安装后怎么用

发布时间:2026-09-06 02:05:54 来源:亿速云 阅读:86 作者:小樊 栏目:系统运维

下面按**“安装后怎么跑起来 → 怎么写程序 → 常用命令/注意事项”**的顺序,给你一个 Linux 上 Spark 的实用入门指南(以 Spark on Linux(单机 / 伪分布式) 为主)。


一、确认 Spark 已安装成功

假设你已经下载并解压了 Spark(如 spark-3.5.1-bin-hadoop3):

cd ~/spark-3.5.1-bin-hadoop3

检查版本:

./bin/spark-submit --version

能看到版本信息,说明安装 OK。


二、两种最常用的使用方式

方式 1:交互式(新手推荐)

1️⃣ Spark Shell(Scala)

./bin/spark-shell

进入后直接写代码:

val data = Seq(1,2,3,4)
val rdd = sc.parallelize(data)
rdd.reduce(_ + _)

2️⃣ PySpark(Python 用户)

./bin/pyspark
data = [1,2,3,4]
rdd = sc.parallelize(data)
rdd.reduce(lambda x,y: x+y)

方式 2:提交 Spark 程序(正式用法)

Python 示例

./bin/spark-submit my_app.py

my_app.py 示例:

from pyspark.sql import SparkSession

spark = SparkSession.builder.appName("demo").getOrCreate()
df = spark.range(10)
df.show()
spark.stop()

Scala / Java

./bin/spark-submit \
  --class com.example.Main \
  my-app.jar

三、本地模式 vs 集群模式

本地模式(默认)

./bin/pyspark --master local[4]

local[4] 表示用 4 个线程

伪分布式 / 集群

./bin/pyspark --master spark://master:7077

需要先启动:

./sbin/start-master.sh
./sbin/start-worker.sh spark://localhost:7077

Web UI:

http://localhost:8080

四、读写数据(很常用)

读文件

df = spark.read.csv("data.csv", header=True)
df.show()

写文件

df.write.mode("overwrite").parquet("output/")

五、环境变量(强烈建议配置)

vim ~/.bashrc

添加:

export SPARK_HOME=~/spark-3.5.1-bin-hadoop3
export PATH=$SPARK_HOME/bin:$PATH

生效:

source ~/.bashrc

之后可以直接:

pyspark
spark-submit app.py

六、常见问题

1️⃣ Java 没装

java -version

没有就装:

sudo apt install openjdk-11-jdk

2️⃣ Python 版本不对

推荐 Python 3.8–3.10

3️⃣ 内存不足

./bin/pyspark --conf spark.driver.memory=2g

七、学习路线建议

  1. RDD 基础
  2. DataFrame / SQL
  3. spark-submit
  4. 集群部署
  5. 调优(内存、并行度)

如果你愿意,可以告诉我:

  • ✅ Spark 版本
  • ✅ 用 Python 还是 Scala
  • ✅ 是否要连 Hadoop / Hive
  • ✅ 单机还是服务器集群

我可以直接给你可运行示例 + 部署方案

向AI问一下细节

免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。

AI