温馨提示×

温馨提示×

您好,登录后才能下订单哦!

密码登录×
登录注册×
其他方式登录
点击 登录注册 即表示同意《亿速云用户服务条款》

linux spark安装注意什么

发布时间:2026-09-06 01:51:55 来源:亿速云 阅读:94 作者:小樊 栏目:系统运维

在 Linux 上安装和部署 Apache Spark 时,有几个关键点和常见“坑”需要注意。下面按顺序给你梳理,适合新手和生产环境参考。


一、安装前准备

1. 确认 Java 环境(最重要)

Spark 依赖 JVM

  • Spark 3.x:推荐 Java 8 / Java 11
  • Spark 2.x:只能 Java 8

检查:

java -version

⚠️ 注意:

  • 不要混用 Java 版本
  • 设置 JAVA_HOME
export JAVA_HOME=/usr/lib/jvm/java-8-openjdk-amd64

2. 选择 Spark 版本

  • 学习:最新稳定版
  • 生产:与 Hadoop / Scala 版本匹配
Spark Scala Hadoop
3.3+ 2.12 3.x
2.4 2.11 2.7+

3. 单机 / 集群模式区分

模式 说明
Local 学习、测试
Standalone Spark 自带集群
YARN Hadoop 环境
K8s 云原生

二、安装方式注意事项

方式 1:二进制包安装(最常用)

wget https://archive.apache.org/dist/spark/spark-3.3.2/spark-3.3.2-bin-hadoop3.tgz
tar -xzf spark-3.3.2-bin-hadoop3.tgz
mv spark-3.3.2-bin-hadoop3 /opt/spark

配置环境变量:

export SPARK_HOME=/opt/spark
export PATH=$SPARK_HOME/bin:$PATH

✅ 注意:

  • 不要放 /root 下(权限问题)
  • 所有节点路径一致

方式 2:源码编译(不推荐新手)

./build/mvn -DskipTests clean package

⚠️ 耗时、易出错


三、关键配置注意点

1. spark-env.sh

export JAVA_HOME=/usr/lib/jvm/java-8-openjdk-amd64
export SPARK_MASTER_HOST=master
export SPARK_WORKER_MEMORY=4g

2. spark-defaults.conf

spark.master    spark://master:7077
spark.executor.memory 2g

⚠️ 内存不要超过物理内存 70%


3. 端口冲突

常见端口:

  • 7077:Master
  • 8080:Web UI
  • 4040:任务 UI

避免被占用(如 Tomcat)


四、集群部署注意

1. 主机名解析

所有节点:

/etc/hosts
192.168.1.10 master
192.168.1.11 worker1

⚠️ 不要用 localhost


2. SSH 免密

ssh-keygen
ssh-copy-id worker1

3. 时间同步

ntpdate cn.pool.ntp.org

五、运行验证

spark-shell

或:

run-example SparkPi 10

六、常见错误

Unsupported major.minor version → Java 版本不对

Worker 无法连接 Master → 防火墙 / hosts / 端口

Memory overhead exceeded → executor 内存设置过大


七、生产建议

  • 用 YARN / K8s 而不是 Standalone
  • 日志统一收集
  • 限制用户资源
  • 定期清理 /tmp/spark*

如果你告诉我:

  • Linux 发行版(CentOS / Ubuntu)
  • Spark 版本
  • 使用模式(学习 / 生产 / YARN)

我可以给你一步一步的具体安装命令

向AI问一下细节

免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。

AI