代码之家  ›  专栏  ›  技术社区  ›  Sinan Erdem

AWS胶水-是否使用爬行器

  •  1
  • Sinan Erdem  · 技术社区  · 7 年前

    对于要在拼花格式的S3 bucket中的数据上运行的作业,有两种方法:

    1. 创建一个爬行器以创建架构表,使用 glueContext.create_dynamic_frame.from_catalog(dbname, tablename) 在粘合作业中形成动态框架。

    2. 直接从S3读取,使用 glueContext.create_dynamic_frame.from_options("s3", {"paths": [full_s3_path] }, format="parquet")

    因为我的数据方案不会随着时间而改变,所以使用爬行器有什么好处吗(从性能上还是其他方面)?在这种情况下,我为什么需要一个爬行器?

    1 回复  |  直到 7 年前
        1
  •  2
  •   Yuriy Bondaruk    7 年前

    如果数据未分区或不想使用 predicate-pushdown 这样你就不需要运行爬虫了。

    但是,如果它是分区的,并且您希望能够使用谓词下推部分加载数据,那么新的分区应该注册到数据目录中,爬虫程序是最简单的方法之一(有 alternatives 虽然)