|
|
1
1
在Dataproc集群上,您可以使用Spark处理来自HDFS和GCS(Google Cloud Storage)的数据,两者都同样有效。集群的大小需要根据您计划在spark作业中执行的计算来决定。在比较一个大型VM和多个(较小)VM时,需要考虑一系列折衷方案——主要是在垂直扩展(使用一个VM)的程度上有一个上限。 |
|
|
2
0
如果您只需要分析来自Google云存储的数据,我建议您在需要时在dataproc上创建一个集群。但这仍然取决于这份工作需要多长时间,以及你多久做一次。 例如,您有一个计划的每小时ETL作业。您可以每小时创建一个新的clusetter,并在作业完成时删除。很划算。 |