Linux下Spark安装后的启动指南
一 环境检查与准备
java -version。echo 'export SPARK_HOME=/opt/spark' >> ~/.bashrc
echo 'export PATH=$PATH:$SPARK_HOME/bin:$SPARK_HOME/sbin' >> ~/.bashrc
source ~/.bashrc
$SPARK_HOME/conf/spark-env.sh 中设置:export HADOOP_CONF_DIR=$HADOOP_HOME/etc/hadoop。二 启动方式
spark-shell --master local[*]pyspark --master local[*]$SPARK_HOME/conf/spark-env.sh:export JAVA_HOME=/usr/lib/jvm/java-11-openjdk-amd64
export SPARK_MASTER_HOST=<MASTER_IP> # 例如 192.168.1.100
# 可按需调整
export SPARK_WORKER_CORES=2
export SPARK_WORKER_MEMORY=2g
$SPARK_HOME/conf/workers(每行一个主机名或 IP):worker1
worker2
$SPARK_HOME/sbin/start-all.sh
# 或分步:
$SPARK_HOME/sbin/start-master.sh
$SPARK_HOME/sbin/start-slaves.sh
$SPARK_HOME/sbin/start-worker.sh spark://<MASTER_IP>:7077jps(应看到 Master/Worker 进程)$SPARK_HOME/sbin/stop-all.shspark-env.sh 中自定义,例如:SPARK_MASTER_WEBUI_PORT=8099。三 提交作业
$SPARK_HOME/bin/spark-submit \
--class org.apache.spark.examples.SparkPi \
--master spark://<MASTER_IP>:7077 \
$SPARK_HOME/examples/jars/spark-examples_*.jar 100
$SPARK_HOME/bin/spark-submit \
--master spark://<MASTER_IP>:7077 \
your_script.py
$SPARK_HOME/bin/spark-submit \
--master yarn \
--deploy-mode cluster \
your_app.py
yarn logs -applicationId <APP_ID>。四 常见问题排查
--executor-memory、--total-executor-cores 是否超过 Worker 配置(SPARK_WORKER_MEMORY/CORES)。/etc/hosts 配置 主机名 ↔ IP 映射,或直接使用 IP。start-all.sh 依赖 SSH 启动远程 Worker,需提前配置免密登录。spark-env.sh 中的 SPARK_MASTER_WEBUI_PORT/SPARK_MASTER_PORT 等端口后重启。java -version 确认 Java 8/11 可用,并正确设置 JAVA_HOME。免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。