|
|
1
1
不是真的。IDF是在整个语料库中全局测量的。IDF的重点是提供一个简单的度量,精确地衡量您正在寻找什么——一个术语有多“重要”。 因此,一个简单的方法就是找到语料库中最经常出现的术语,并根据文档频率对它们进行加权。 |
|
|
3
0
编辑:我仍然没有得到你想要的。 高tf/idf值意味着这个术语是有用的 用于区分此文档与集合的其余部分 也就是说,这个术语在特定的文档中比在一般的集合中更频繁。因此,它在收集背景下“表示”文档。这就是你想要的吗? 一种可能的方法来重新表述您的问题是,您希望使用一些高频术语压缩集合。这意味着在集合中出现很多单词,可以通过使用IDF低的单词来完成。 另一种选择是,您希望以某种简洁的方式在更一般的背景下表示集合,例如更大的集合或整个www。在这种情况下,您希望比较集合之间的词频,考虑 mutual information 在单词类型和集合之间,或其他 feature selection 方法。 如果我仍然不明白你的意思,请说出来。 |
|
|
4
0
contrib/文件夹有一个类来生成最频繁的术语列表: http://svn.apache.org/repos/asf/lucene/dev/trunk/lucene/contrib/misc/src/java/org/apache/lucene/misc/HighFreqTerms.java 如果您正在寻找语义特征提取,您可以查看 http://project.carrot2.org/ |