代码之家  ›  专栏  ›  技术社区  ›  J.T.

多词同义词和奇数标记顺序

  •  0
  • J.T.  · 技术社区  · 12 年前

    为什么同义词TokenFilter将扩展术语放在多词同义词中第一个标记的匹配之后?当我使用弹性搜索时,这当然也适用于任何solr/lucene大师。我只在索引时间内使用,但它与带状疱疹结合使用,所以顺序非常重要。

    我有一个同义词:

    爆米花机

    我的同义词TokenFilter通过elasticsearch中的默认值expand=true。

    当我查看我的代币时,爆米花机总是插入爆米花和爆米花机之间,无论输入项是爆米花机还是爆米花机。

    示例分析“ 爆米花机 "

     t1:Popcorn t2:popcorn t3:machine t4:popper
    

    示例分析“ 爆米花机 "

      t1:Popcorn t2:popcorn t3:machine t4:popper
    
    1 回复  |  直到 12 年前
        1
  •  1
  •   Alexandre Rafalovitch    12 年前

    Lucene令牌流 is actually a graph 像同义词这样的东西确实会导致图形模型和标记偏移量出现问题。然而,在更新的Lucene版本中,情况正在改善。您可能只需要查看(Solr和Lucene)Jiras即可找到相关的讨论。

    推荐文章