|
|
1
7
朱莉娅,看来你要找的是 n-grams ,特别是 Bigrams (也叫搭配)。 chapter about finding collocations (PDF) 从曼宁和舒茨那里 Foundations of Statistical Natural Language Processing . 为了对Lucene做到这一点,我建议使用 Solr 具有 ShingleFilterFactory . this discussion 详情。 |
|
|
2
0
你有没有可能发布你写的任何代码?
让我们考虑一个例子,其中有两个字段: 现在在现实生活中,将我的ID:“finding nemo”作为两个不同的可搜索字符串是没有意义的。而我想索引评论中的所有内容。
所以我要做的是,创建一个文档(
因此,我基本上创建了两个字段:
这就是为默认标记器和分析器定制lucene的方法。否则,您可以编写自己的标记器和分析器。 链接 http://darksleep.com/lucene/
|
|
|
3
0
短语上下文丢失的问题可以通过使用PhraseQuery来解决。 通过使用omitTermFreqAndPositions选项索引字段。 PhraseQuery使用此信息来定位术语之间在一定距离内的文档。 要视为匹配的项之间的最大允许位置距离称为slop。 距离是按顺序重建短语的词的位置移动次数。 退房 Lucene's JavaDoc for PhraseQuery See this example code which demonstrates how to work with various Query Objects: 您还可以尝试在BooleanQuery类的帮助下组合各种查询类型。
|