代码之家  ›  专栏  ›  技术社区  ›  Thomas Hahn

Dataframe.head()需要花费很长时间

  •  0
  • Thomas Hahn  · 技术社区  · 7 年前

    我从Blob存储中导入了一个JSON文件,大小约为50GB。

    dsm_temperature_df = spark.read.json(file_location, multiLine=True)
    

    导入到DataRicks spark数据帧(大约需要40分钟)后,我想用 df.head() . 不幸的是,这需要永远。我让它运行了60分钟,但后来我停止了它。我在这里做错什么了吗?

    PS:我发现,对于一个较小的json文件,它包含大约1GB的数据,执行 df.head() df.first() 方法。对于50GB json,这意味着需要100多分钟才能获得第一行。这不可能是真的,不是吗?

    1 回复  |  直到 7 年前
        1
  •  0
  •   Thomas Hahn    7 年前

    问题出现在以前的代码中。数据转换错误,因此数据帧被破坏。