代码之家  ›  专栏  ›  技术社区  ›  Sai

如何在pyspark中仅从数据帧中选择70%的重编码?

  •  0
  • Sai  · 技术社区  · 7 年前

    我有一个数据框如下

    +----+-----+--------------------+
    |test|count|             support|
    +----+-----+--------------------+
    |   A|    5| 0.23809523809523808|
    |   B|    5| 0.23809523809523808|
    |   C|    4| 0.19047619047619047|
    |   K|    2| 0.09523809523809523|
    |   G|    2| 0.09523809523809523|
    |   L|    1|0.047619047619047616|
    |   D|    1|0.047619047619047616|
    |   F|    1|0.047619047619047616|
    +----+-----+--------------------+
    

    我只想从pyspark中的给定数据帧中选择前75%的记录。

    +----+-----+--------------------+
    |test|count|             support|
    +----+-----+--------------------+
    |   A|    5| 0.23809523809523808|
    |   B|    5| 0.23809523809523808|
    |   C|    4| 0.19047619047619047|
    |   K|    2| 0.09523809523809523|
    |   G|    2| 0.09523809523809523|
    |   L|    1|0.047619047619047616|
    +----+-----+--------------------+
    
    0 回复  |  直到 7 年前
        1
  •  0
  •   Oli    7 年前

    你可以计算数据帧的大小乘以它 0.75 使用 limit 功能看起来是这样的:

    df75 = df.limit(int(df.count() * 0.75))