我正在使用 H2O's AutoML 数据科学项目。然而,在文档、互联网或代码中,我找不到automl如何处理因子变量——它是做一个热编码的吗?标签编码?有更先进的吗?是否考虑有多少个级别?这取决于算法吗?
目前,automl的表现非常糟糕(略高于基线),我怀疑这是因为它没有正确地对待分类,这占了我预测的90%。
automl自动运行在h2o-3中可用的监督学习模型。因此,automl如何处理类别取决于它所运行的给定模型的默认类别处理。可以找到有关分类处理的文档 here 如果您对特定的算法感兴趣,请使用相同的文档查找感兴趣的算法,并查看它如何处理分类值的详细信息,或者使用python或r api文档查找默认值。