java -version验证版本,若版本不符,用update-alternatives --config java切换默认版本。conda或apt安装以管理依赖。spark-3.3.2-bin-hadoop3.tgz对应Hadoop 3.x),避免因API不兼容导致运行错误。-bin-hadoopX后缀的预编译包(无需额外编译)。sudo tar -xzf spark-*.tgz -C /opt解压到/opt等系统目录,便于统一管理。建议用ln -s创建软链接(如/opt/spark),方便后续升级。~/.bashrc(或~/.zshrc)中添加以下内容,替换为实际路径:export SPARK_HOME=/opt/spark-3.3.2-bin-hadoop3 # Spark安装目录
export PATH=$SPARK_HOME/bin:$SPARK_HOME/sbin:$PATH # 添加Spark命令到PATH
export JAVA_HOME=/usr/lib/jvm/java-8-openjdk-amd64 # Java安装目录(根据实际调整)
source ~/.bashrc使变量立即生效,通过echo $SPARK_HOME验证是否配置正确。cp $SPARK_HOME/conf/spark-env.sh.template $SPARK_HOME/conf/spark-env.sh,添加以下关键配置:export JAVA_HOME=/usr/lib/jvm/java-8-openjdk-amd64 # Java路径
export SPARK_MASTER_HOST=localhost # 单机模式为本机,集群模式为Master节点IP
export SPARK_MASTER_PORT=7077 # Master节点通信端口(默认7077)
cp $SPARK_HOME/conf/slaves.template $SPARK_HOME/conf/slaves,添加Worker节点IP或主机名(每行一个)。7077(Master通信)、8080(Master Web UI)、4040(Spark Shell Web UI)等端口。通过netstat -tulnp | grep 端口号检查端口占用,若有冲突,修改spark-env.sh中的端口或停止占用进程。ufw或firewalld),需开放Spark相关端口。例如,使用ufw allow 7077/tcp允许Master通信,ufw allow 8080/tcp允许Web UI访问。spark)安装和运行Spark,避免使用root用户,提升安全性。通过useradd -m spark创建用户,passwd spark设置密码。sudo chown -R spark:spark /opt/spark-3.3.2-bin-hadoop3,避免权限不足导致的读写错误。spark-shell,若出现Scala REPL界面(如Spark context available as 'sc'),说明安装成功。可通过sc.parallelize(1 to 10).sum()执行简单计算验证功能。http://<master-ip>:8080(单机模式为本机IP),查看Spark集群状态(如Master节点、Worker节点是否注册)。--packages选项自动下载依赖(如spark-shell --packages org.apache.spark:spark-sql-kafka-0-10_2.12:3.3.2)。OutOfMemoryError,修改spark-defaults.conf中的内存配置(如spark.driver.memory 2g、spark.executor.memory 4g),或调整YARN的内存限制(如yarn.nodemanager.resource.memory-mb)。ulimit -n 10240临时增加文件描述符数量,或修改/etc/security/limits.conf永久生效。免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。