代码之家  ›  专栏  ›  技术社区  ›  user1393608

spark filter out columns和create dataframe with remaining columns和create dataframe with filtered columns

  •  -2
  • user1393608  · 技术社区  · 7 年前

    我是新来的火花。

    我已经将一个csv文件加载到一个spark数据框中,比如说originaldf

    现在我想 1。从中筛选出一些列,并创建一个新的originaldf数据帧 2。从提取的列中创建数据帧

    如何在Spark scala中创建这两个数据帧?

    1 回复  |  直到 7 年前
        1
  •  1
  •   NNK    7 年前

    使用“选择”,可以选择所需的列。

    val df2 = OriginalDF.select($"col1",$"col2",$"col3")
    

    使用过滤器,您应该能够过滤行。

    val df3 = OriginalDF.where($"col1" < 10)
    

    另一种过滤数据的方法是使用where。过滤器和where都是同义词,因此可以互换使用它们。

    val df3 = OriginalDF.filter($"col1" < 10)
    

    注意:选择和筛选将返回一个新的数据帧。