我有一个包含多列的数据帧。我正在索引2列-ID和Entity_ID。索引后,我运行计数操作,但最后一个阶段失败,出现错误-
`unseen label: 00000167dea2e045a67f8695b0143e14. To handle unseen labels, set Param handleInvalid to keep.`
我无法理解这个错误,因为我没有使用StringIndexer来转换不同的数据帧。我正在对相同的数据进行拟合和转换。
以下是我正在运行的一段代码,它最终失败了。
操作前的数据帧名称-final_df
idx_model_1 = StringIndexer(inputCol="id", outputCol="id_index")
idx_model_2 = StringIndexer(inputCol="entity_id", outputCol="entity_id_index")
df=idx_model_1.transform(final_df)
df=idx_model_2.transform(df)
df.count()
出现此错误的原因可能是什么?
我使用的pyspark版本是“2.4.4.4.1.8.29”