首页手记 Spark DataFrame 的 groupBy...

Spark DataFrame 的 groupBy vs groupByKey

标签：

Spark

在使用 Spark SQL 的过程中，经常会用到 groupBy 这个函数进行一些统计工作。但是会发现除了 groupBy 外，还有一个 groupByKey（注意RDD 也有一个 groupByKey，而这里的 groupByKey 是 DataFrame 的 ）。这个 groupByKey 引起了我的好奇，那我们就到源码里面一探究竟吧。

所用 spark 版本：spark 2.1.0

先从使用的角度来说，
groupBy：groupBy类似于传统SQL语言中的group by子语句，但比较不同的是groupBy()可以带多个列名，对多个列进行group。比如想根据 "id" 和 "name" 进行 groupBy 的话可以

df.goupBy("id","name")

groupBy返回的类型是RelationalGroupedDataset。

groupByKey：groupByKey则更加灵活，可以根据用户自己对列的组合来进行groupBy，比如上面的那个例子，根据 "id" 和 "name" 进行 groupBy，使用groupByKey可以这样。

//同前面的goupBy效果是一样的，但返回的类型是不一样的df..toDF("id","name").goupByKey(row =>{    row.getString(0) + row.getString(1)
})

但和groupBy不同的是groupByKey返回的类型是KeyValueGroupedDataset。

下面来看看这两个方法的实现有何区别。

groupBy

  def groupBy(cols: Column*): RelationalGroupedDataset = {
    RelationalGroupedDataset(toDF(), cols.map(_.expr), RelationalGroupedDataset.GroupByType)
  }

最终会去新建一个RelationalGroupedDataset，而这个方法提供count()，max()，agg()，等方法。值得一提的是，这个类在spark1.x的时候类名为“GroupedData”。看看类中的注释吧

/**
 * A set of methods for aggregations on a `DataFrame`, created by `Dataset.groupBy`.
 *
 * The main method is the agg function, which has multiple variants. This class also contains
 * convenience some first order statistics such as mean, sum for convenience.
 *
 * This class was named `GroupedData` in Spark 1.x.
 *
 * @since 2.0.0
 */
@InterfaceStability.Stableclass RelationalGroupedDataset protected[sql](

groupByKey

  @Experimental
  @InterfaceStability.Evolving
  def groupByKey[K: Encoder](func: T => K): KeyValueGroupedDataset[K, T] = {    val inputPlan = logicalPlan    val withGroupingKey = AppendColumns(func, inputPlan)    val executed = sparkSession.sessionState.executePlan(withGroupingKey)    new KeyValueGroupedDataset(      encoderFor[K],      encoderFor[T],      executed,      inputPlan.output,      withGroupingKey.newColumns)
  }

可以发现最后生成和返回的类是KeyValueGroupedDataset。这是dataset的子类，表示聚合过之后的dataset。
我们再看看这个类中的注释吧

/**
 * :: Experimental ::
 * A [[Dataset]] has been logically grouped by a user specified grouping key.  Users should not
 * construct a [[KeyValueGroupedDataset]] directly, but should instead call `groupByKey` on
 * an existing [[Dataset]].
 *
 * @since 2.0.0
 */@Experimental@InterfaceStability.Evolving
class KeyValueGroupedDataset[K, V] private[sql](

可以发现 groupByKey 还处于实验阶段。它是希望可以由用户自己来实现 groupBy 的规则，而不像 groupBy() 一样，需要被列属性所束缚。
通过 groupByKey 用户可以按照自己的需求来进行 grouping 。

总而言之，groupByKey虽然提供了更加灵活的处理 grouping 的方式，但 groupByKey 后返回的类是 KeyValueGroupedDataset ，它里面所提供的操作接口也不如 groupBy 返回的 RelationalGroupedDataset 所提供的接口丰富。除非真的有一些特殊的 grouping 操作，否则还是使用 groupBy 吧。

原文出处：https://www.cnblogs.com/listenfwind/p/9860228.html

点击查看更多内容

为 TA 点赞

若觉得本文不错，就分享一下吧！

评论

评论

共同学习，写下你的评论

评论加载中...

展开查看更多评论

作者其他优质文章

正在加载中

蝴蝶刀刀

手记
篇

粉丝

38

获赞与收藏

184

关注作者，订阅最新文章

阅读免费教程

后端通用面试教程

41个小节 32882 371

网络编程入门教程

20个小节 13640 256

Pandas 入门教程

25个小节 20282 387

推荐

评论

收藏

共同学习，写下你的评论



感谢您的支持，我会继续努力的～

扫码打赏，你说多少就多少

赞赏金额会直接到老师账户

支付方式

打开微信扫一扫，即可进行扫码打赏哦

今天注册有机会得

100积分直接送

付费专栏免费学

大额优惠券免费领

立即参与放弃机会

点击
抽奖

慕课手记新用户专享福利

恭喜你，你的运气太好了，居然抽中了 100个积分！

恭喜你，抽中了价值元的专栏！

太棒了，直接落到你账户里！

积分商城里的罗技鼠标、机械键盘、
Kindle 阅读器、小米平衡车
Apple iPad （10.2英寸）、大额优惠券
在等着你去兑换了噢

作者：

免费赠送

兑换码：1111222211 复制

优惠券可用于购买实战课、体系课
无门槛使用

先去看看，有什么好东西马上兑换我爱学习，选课去


热搜

最近搜索清空

Spark DataFrame 的 groupBy vs groupByKey

groupBy

groupByKey

阅读免费教程