前面介绍了RDD以及DataFrame,今天来简单介绍一下DataSet。DataSet是从spark2.0版本开始,正式使用。
官网对DataSet的定义如下
A Dataset is a strongly typed collection of domain-specific objects that can be transformed in parallel using functional or relational operations. Each Dataset also has an untyped view called a DataFrame, which is a Dataset of Row
Dataset是特定域对象中的强类型集合,它可以使用函数或者相关操作并行地进行转换等操作。每个Dataset都有一个称为DataFrame的非类型化的视图,这个视图是行的数据集。
RDD和DataSet的区别
DataSet是特定域的对象集合;然而RDD是任何对象的集合。DataSet的API总是强类型的;而且可以利用这些模式进行优化,然而RDD却不行。同时,DataFrame是特殊的Dataset,可以理解为DataSet的特例。
DataSet操作
读取数据并将它转换成Dataset

分割单词
使用sparkSession提供的read方法来读取类型为text的文本文件。最终每一个单词都为string格式。

计数

和RDD的操作很像。我们也可以按如下的方式操作DataSet:

如有问题,欢迎指正。
文章转载自奶啤配炸鸡,如果涉嫌侵权,请发送邮件至:contact@modb.pro进行举报,并提供相关证据,一经查实,墨天轮将立刻删除相关内容。




