我参加了一个黑客活动,我们应该预测用户是否对具有性别、城市、培训时间、经验、当前公司等特征的工作感兴趣。
在培训中,约有90%的人对工作不感兴趣,而只有10%的人对工作感兴趣。 但是在公开的测试中,他们发布了两个等级的测试中有50%的测试结果,我的验证准确度不超过55%,而培训准确度为99%。
测试和培训数据都有缺失的值,I_m使用RBM进行输入。
我的问题是:
验证的准确性很差是因为类的比例不平衡,还是因为错误地输入了缺失的值?
我会尝试使用简单的over-and检查这是否解决了您的问题。
对于python,您可以使用所谓的 imbalanced-learn 包,其中包含此处所述的所有方法。