温馨提示×

温馨提示×

您好,登录后才能下订单哦!

密码登录×
登录注册×
其他方式登录
点击 登录注册 即表示同意《亿速云用户服务条款》

Spark在Linux上的安装依赖有哪些

发布时间:2025-11-14 19:28:03 来源:亿速云 阅读:124 作者:小樊 栏目:系统运维

Spark在Linux上的安装依赖清单

一 核心依赖

  • Java Development Kit JDK:必选。生产常用 JDK 8 或 JDK 11;如使用 Spark 2.x,通常要求 JDK 8。需正确设置环境变量 JAVA_HOME。
  • Apache Hadoop(可选):仅在使用 HDFS/YARN 或访问 Hadoop 生态组件时安装;若仅本地模式或 Standalone 模式可暂不安装。
  • Python(可选):使用 PySpark 时安装 Python 3.x,并确保与集群的 Spark 版本兼容。
  • Scala(版本相关):使用 Spark 2.x 时建议安装与发行版匹配的 Scala;Spark 3.x 自带内置的 Scala 运行时,通常无需单独安装。

二 集群部署常见依赖

  • SSH 免密登录:多节点集群部署时,主节点需能通过 SSH 免密登录到各工作节点,以便分发配置与启停服务。
  • Hadoop 客户端配置(可选):当 Spark 访问 HDFS/YARN 时,需在各节点配置 HADOOP_HOME 与 HADOOP_CONF_DIR 指向 Hadoop 配置目录。

三 系统与网络要求

  • 操作系统:常见为 CentOS 7+ 或 Ubuntu 18.04+ 等主流发行版。
  • 硬件资源:建议至少 2 核 CPU、4GB 内存、20GB+ 可用磁盘,以保证基本运行与测试。
  • 端口与防火墙:默认 Master Web UI 端口 8080、Master 通信端口 7077;需确保端口未被占用并放通防火墙规则。

四 版本选择与依赖对应

场景 建议 JDK 是否需 Hadoop 是否需 Scala 其他说明
Spark 2.x 本地/Standalone JDK 8 否 建议安装匹配版本 需设置 JAVA_HOME
Spark 2.x 集群 + HDFS/YARN JDK 8 是 建议安装匹配版本 需配置 HADOOP_HOME/HADOOP_CONF_DIR
Spark 3.x 本地/Standalone JDK 8 或 JDK 11 否 一般不需要 自带 Scala 运行时
Spark 3.x 集群 + HDFS/YARN JDK 8 或 JDK 11 是 一般不需要 建议与 Hadoop 版本匹配
PySpark JDK 8 或 JDK 11 视存储/调度而定 不需要 需 Python 3.x 且与 Spark 版本兼容
向AI问一下细节

免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。

AI
助
手