暂无图片
暂无图片
暂无图片
暂无图片
暂无图片

Spark系列(一):基本概念(3)

奶啤配炸鸡 2017-05-31
163

    前面介绍了RDD以及DataFrame,今天来简单介绍一下DataSet。DataSet是从spark2.0版本开始,正式使用。

  • 官网对DataSet的定义如下    

A Dataset is a strongly typed collection of domain-specific objects that can be transformed in parallel using functional or relational operations. Each Dataset also has an untyped view called a DataFrame, which is a Dataset of Row

    Dataset是特定域对象中的强类型集合,它可以使用函数或者相关操作并行地进行转换等操作。每个Dataset都有一个称为DataFrame的非类型化的视图,这个视图是行的数据集。

  • RDD和DataSet的区别

    DataSet是特定域的对象集合;然而RDD是任何对象的集合。DataSet的API总是强类型的;而且可以利用这些模式进行优化,然而RDD却不行。同时,DataFrame是特殊的Dataset,可以理解为DataSet的特例。

  • DataSet操作

    • 读取数据并将它转换成Dataset

    使用sparkSession提供的read方法来读取类型为text的文本文件。最终每一个单词都为string格式。

    • 分割单词

    • 计数     

和RDD的操作很像。我们也可以按如下的方式操作DataSet:

如有问题,欢迎指正。


文章转载自奶啤配炸鸡,如果涉嫌侵权,请发送邮件至:contact@modb.pro进行举报,并提供相关证据,一经查实,墨天轮将立刻删除相关内容。

评论