spark中各种连接操作以及有用方法「建议收藏」

spark中各种连接操作以及有用方法

大家好,又见面了,我是全栈君。

 val a = sc.parallelize(Array(("123",4.0),("456",9.0),("789",9.0))
     val b = sc.parallelize(Array(("123",8.0),("789",10)))

    val c = a.join(b)
    c.foreach(println)
    /*
    (123,(4.0,8.0))
    (789,(9.0,10))
     */
    val d = a.cogroup(b)
    d.foreach(println)
    /*
    (456,(CompactBuffer(9.0),CompactBuffer()))
    (123,(CompactBuffer(4.0),CompactBuffer(8.0)))
    (789,(CompactBuffer(9.0),CompactBuffer(10)))
    */
    val e = a.leftOuterJoin(b)
    e.foreach(println)
    /*
      (456,(9.0,None))
      (123,(4.0,Some(8.0)))
      (789,(9.0,Some(10)))
      */
    val f = a.fullOuterJoin(b)
    f.foreach(println)
    /*
      (456,(Some(9.0),None))
      (123,(Some(4.0),Some(8.0)))
      (789,(Some(9.0),Some(10)))
      */
    val g = a.cartesian(b)
    g.foreach(println)
    /*
((123,4.0),(123,8.0))
((123,4.0),(789,10))
((456,9.0),(123,8.0))
((456,9.0),(789,10))
((789,9.0),(123,8.0))
((789,9.0),(789,10))
      */
    /*val h = a.coalesce(6,true)
    h.foreach(println)
    a.dependencies.foreach(println)*/
    val i = a.keyBy{case (k,v)=>("haha",234)}
    i.foreach(println)
    /*
      ((haha,234),(123,4.0))
      ((haha,234),(456,9.0))
      ((haha,234),(789,9.0))
     */

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容, 请联系我们举报,一经查实,本站将立刻删除。

发布者:全栈程序员-站长,转载请注明出处:https://javaforall.net/116173.html原文链接:https://javaforall.net

(0)
上一篇 2022年1月25日 上午7:00
下一篇 2022年1月25日 上午7:00


相关推荐

  • kali 国内源 与 apt-get update 报错-GPG error的解决方案[通俗易懂]

    kali 国内源 与 apt-get update 报错-GPG error的解决方案[通俗易懂]#中科大debhttp://mirrors.ustc.edu.cn/kalikali-rollingmainnon-freecontribdeb-srchttp://mirrors.ustc.edu.cn/kalikali-rollingmainnon-freecontrib#浙大debhttp://mirrors.zju.edu.cn/kalikali-rol…

    2022年10月13日
    10
  • 在大数据中如何寻找相似的文档(shingle, minhash, LSH)(一)

    在大数据中如何寻找相似的文档(shingle, minhash, LSH)(一)场景 在一堆非常多的文档中 找到相似的文档 或者对文档间的相似性进行评估 当应用于此类目的的时候 我们最常用的用来表示一篇文档的方法是 shingling 1 k shingles nbsp nbsp nbsp 可以把一篇文档看成一个字符串 那么一篇文档的 k shingle 就是在这篇文档中出过现的任何长度为 k 的字符串 k shingles 就是改篇文档所有 k shingle 的集合 那么 k 的大小决定于什么

    2026年3月19日
    3
  • 逆向 Framework.jar

    逆向 Framework.jar

    2021年12月15日
    48
  • mybatis底层通过什么实现_priorityqueue java

    mybatis底层通过什么实现_priorityqueue java一、概述最近接触了一些项目,发现很多项目最开始的时候Service接口和实现类一个方法都没有,通过继承通用底层能够使用基本的增删改查操作了。这种骚操作以前听过但是着实没有亲手实现过,今天参考着自己实

    2022年8月16日
    9
  • Java SDK和Java JDK的区别

    Java SDK和Java JDK的区别sdk jdk jre 的区别一 JDK 与 jre 简单的说 JDK 是面向开发人员使用的 SDK 它提供了 Java 的开发环境和运行环境 SDK 是 SoftwareDeve 一般指软件开发包 可以包括函数库 编译程序等 JDK 就是 JavaDevelopm 是 JavaRuntimeE 是指 Java 的运行环境 是面向 Java 程序的使用者 而不

    2026年3月26日
    3
  • 韩顺平php从入门到精通讲义,传智播客_韩顺平_php从入门到精通

    韩顺平php从入门到精通讲义,传智播客_韩顺平_php从入门到精通传智播客 韩顺平 php 从入门到精通视频教程第 029 讲 apache 服务器使用及配置 apache 虚拟主机 web 访问时序图 wmv 传智播客 韩顺平 php 从入门到精通视频教程第 042 讲循环控制 for wmv 传智播客 韩顺平 php 从入门到精通视频教程第 094 讲 php 数据库编程 使用 mysqli 扩展库 wmv 传智播客 韩顺平 php 从入门到精通视频教程第 118 讲 se

    2026年3月20日
    2

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

关注全栈程序员社区公众号