|
|
1
1
你需要找到一种适合你的问题的降维方法。 我曾处理过一个与您类似的问题,我发现信息增益工作得很好,但也有其他问题。 我发现这篇论文(Fabrizio Sebastiani,《自动文本分类中的机器学习》,ACM计算调查,第34卷,第1期,第1-47页,2002年)是文本分类的一个很好的理论处理,包括通过从简单(术语频率)到复杂(信息理论)的各种方法进行特征约简。
这些技巧帮助您选择在将培训文档划分为给定课程时最有用的术语;对您的问题具有最高预测值的术语。 我已经成功地将信息增益用于特征缩减,并发现这篇论文(基于熵的文本分类特征选择Largeron、Christine和Moulin、Christophe和Gry、Mathias-SAC-第924-928页2011)是非常好的实用指南。 在这里,作者提出了一个基于熵的特征选择的简单公式,这对代码中的实现很有用:
使用该应急表,信息增益可通过以下方式估算:
该方法易于实现,并提供了非常好的信息论特征约简。 你也不需要使用单一的技术;你可以把它们组合起来。Ter频率很简单,但也可以有效。我已经将信息增益方法与术语频率相结合,成功地进行了特征选择。你应该对你的数据进行实验,看看哪种技术最有效。 |
|
|
2
0
首先,你可以简单地删除所有高频词和所有低频词,因为这两个词都不会告诉你文本的内容,然后你必须做词干。 之后,您可以尝试降低空间的维度 Feature hashing 或者更高级的降维技巧( PCA , ICA ),甚至两者都有。 |