我正在使用Spark结构化流媒体API从HDFS读取文件。 但模式并不是固定的。我用的是:
sql.streaming.schemaInference: "true"
因此,每个批次的模式可能不同。 因此,如果我尝试使用以下命令选择行:
dataframe.select(columnName)
如果该专栏不存在,它会抱怨。 那么,在使用结构化流媒体api时,有没有办法在选择该列之前检查该列是否不存在?