代码之家  ›  专栏  ›  技术社区  ›  mandok

Google云上的Apache Spark,集群或无集群

  •  0
  • mandok  · 技术社区  · 7 年前

    我想使用Apache Spark来操作Google云中的大量数据。

    我按照文档的说明启动了一个有5个节点的云Dataproc集群。一切都完美无瑕。

    在这种情况下,是否有必要对整个集群进行自旋操作?Spark在Google云存储上的效率是否和在HDFS上一样?

    如果不是,那就更容易用Jupyter和Spark旋转一个大型VM,并用它在GCS上存储的数据上运行作业。

    2 回复  |  直到 7 年前
        1
  •  1
  •   Aniket Mokashi    7 年前

    在Dataproc集群上,您可以使用Spark处理来自HDFS和GCS(Google Cloud Storage)的数据,两者都同样有效。集群的大小需要根据您计划在spark作业中执行的计算来决定。在比较一个大型VM和多个(较小)VM时,需要考虑一系列折衷方案——主要是在垂直扩展(使用一个VM)的程度上有一个上限。

        2
  •  0
  •   howie    7 年前

    如果您只需要分析来自Google云存储的数据,我建议您在需要时在dataproc上创建一个集群。但这仍然取决于这份工作需要多长时间,以及你多久做一次。

    例如,您有一个计划的每小时ETL作业。您可以每小时创建一个新的clusetter,并在作业完成时删除。很划算。