代码之家  ›  专栏  ›  技术社区  ›  Naveen Cotha

Apache Spark上具有错误架构的Readstream正在重试1830次

  •  0
  • Naveen Cotha  · 技术社区  · 7 年前

    在Spark结构化流媒体中,当来自S3的传入记录与我使用的模式不匹配时 .schema(..)

    1 回复  |  直到 7 年前
        1
  •  0
  •   Naveen Cotha    7 年前

    在我的例子中,s3对象是一个json数组,结果表明spark-s3 json阅读器将数组的每个条目作为spark dataframe中的一条单独记录进行处理。因此,s3对象有1830个项,这就是为什么同一个s3对象迭代1830个项时出现错误的原因。然而,我找不到任何关于这种行为的官方文件。