代码之家  ›  专栏  ›  技术社区  ›  user8625479

Pyspark StringIndexer在对Dataframe中的列进行索引并获取行数时引发“看不见的标签”错误

  •  0
  • user8625479  · 技术社区  · 3 年前

    我有一个包含多列的数据帧。我正在索引2列-ID和Entity_ID。索引后,我运行计数操作,但最后一个阶段失败,出现错误-

    `unseen label: 00000167dea2e045a67f8695b0143e14. To handle unseen labels, set Param handleInvalid to keep.`
    

    我无法理解这个错误,因为我没有使用StringIndexer来转换不同的数据帧。我正在对相同的数据进行拟合和转换。 以下是我正在运行的一段代码,它最终失败了。

    操作前的数据帧名称-final_df

    idx_model_1 = StringIndexer(inputCol="id", outputCol="id_index")
    idx_model_2 = StringIndexer(inputCol="entity_id", outputCol="entity_id_index")
    df=idx_model_1.transform(final_df)
    df=idx_model_2.transform(df)
    
    df.count()
    

    出现此错误的原因可能是什么? 我使用的pyspark版本是“2.4.4.4.1.8.29”

    0 回复  |  直到 3 年前
    推荐文章