|
|
1
6
如果对数据进行过采样,然后进行分割,测试中的少数样本将不再独立于训练集中的样本,因为它们是一起生成的。在您的情况下,它们是训练集中样本的精确副本。您的准确率是100%,因为分类器正在对训练中已经看到的样本进行分类。 由于您的问题是严重不平衡的,我建议使用一组分类器来处理它。1) 在训练集和测试集中拆分数据集。给定数据集的大小,您可以从少数类中抽取1-2个样本进行测试,并将另一个留作培训。2) 通过训练,您生成了N个数据集,其中包含少数类的所有剩余样本和多数类的不足样本(我想说少数类中的样本数为2*。3) 对于获得的每个数据集,您都训练一个模型。4) 使用测试集获得预测;最终预测结果将是分类器所有预测的多数投票结果。
|
|
2
1
上采样后不应分割数据集。您可以在训练数据中进行上采样。 基本上,您正在将测试数据泄漏到训练数据中。 |
|
|
3
0
|