大数据工具pyspark怎么用

发布时间：2021-12-17 09:39:03 来源：亿速云阅读：166 作者：柒染栏目：大数据

本篇文章给大家分享的是有关大数据工具pyspark怎么用，小编觉得挺实用的，因此分享给大家学习，希望大家阅读完这篇文章后可以有所收获，话不多说，跟着小编一起来看看吧。

spark是目前大数据领域的核心技术栈，许多从事数据相关工作的小伙伴都想驯服它，变成"驯龙高手"，以便能够驾驭成百上千台机器组成的集群之龙来驰骋于大数据之海。

但大部分小伙伴都没能成功做到这一点。有一部分小伙伴纠结在到底是学pyspark还是spark-scala上面迟迟未能出征，还有相当一部分倒在了开始的环境配置上，还有一些在几十几百个函数的用法中迷失了方向，还有少部分同学虽然掌握了一些简单用法，但是没有掌握性能优化技巧，一旦遇到真正复杂的大数据就毫无办法。

一，pyspark or spark-scala

pyspark强于分析，spark-scala强于工程。

如果应用场景有非常高的性能需求，应该选择spark-scala.

如果应用场景有非常多的可视化和机器学习算法需求，推荐使用pyspark，可以更好地和python中的相关库配合使用。

此外spark-scala支持spark graphx图计算模块，而pyspark是不支持的。

pyspark学习曲线平缓，spark-scala学习曲线陡峭。

从学习成本来说，spark-scala学习曲线陡峭，不仅因为scala是一门困难的语言，更加因为在前方的道路上会有无尽的环境配置痛苦等待着读者。

而pyspark学习成本相对较低，环境配置相对容易。从学习成本来说，如果说pyspark的学习成本是3，那么spark-scala的学习成本大概是9。

如果读者有较强的学习能力和充分的学习时间，建议选择spark-scala，能够解锁spark的全部技能，并获得最优性能，这也是工业界最普遍使用spark的方式。

如果读者学习时间有限，并对Python情有独钟，建议选择pyspark。pyspark在工业界的使用目前也越来越普遍。

二，本书学习方案

1，学习计划

非常适合作为pyspark的工具手册在工程落地时作为范例库参考。

2，学习环境

全部源码在jupyter中编写测试通过，建议通过git克隆到本地，并在jupyter中交互式运行学习。

为了直接能够在jupyter中打开markdown文件，建议安装jupytext，将markdown转换成ipynb文件。

按照如下2个步骤配置单机版spark3.0.1环境进行练习。

#step1: 安装java8#jdk
#step2: 安装pyspark,findsparkpip install -i

此外，也可以在和鲸社区的云端notebook中直接运行pyspark，没有任何环境配置痛苦。

import findspark

#指定spark_home,指定python路径
spark_home = "/Users/liangyun/anaconda3/lib/python3.7/site-packages/pyspark"
python_path = "/Users/liangyun/anaconda3/bin/python"
findspark.init(spark_home,python_path)

import pyspark 
from pyspark import SparkContext, SparkConf
conf = SparkConf().setAppName("test").setMaster("local[4]")
sc = SparkContext(conf=conf)

print("spark version:",pyspark.__version__)
rdd = sc.parallelize(["hello","spark"])
print(rdd.reduce(lambda x,y:x+' '+y))

以上就是大数据工具pyspark怎么用，小编相信有部分知识点可能是我们日常工作会见到或用到的。希望你能通过这篇文章学到更多知识。更多详情敬请关注亿速云行业资讯频道。

向AI问一下细节

大数据工具pyspark怎么用

一，pyspark or spark-scala

二，本书学习方案

猜你喜欢

最新资讯

相关推荐

相关标签