代码之家  ›  专栏  ›  技术社区  ›  Darren Cook

可能平衡unidic与unidic neologd?

  •  3
  • Darren Cook  · 技术社区  · 9 年前

    使用以下句子“很难找到,但这是一个好地方。”) mecab 具有 -d mecab-unidic-neologd

    場所  バショ バショ 場所  名詞-固有名詞-人名-姓
    

    場所  バショ バショ 場所  名詞-普通名詞-一般      
    

    我的第一个问题是,unidic新词替换了unidic中的所有词条,还是仅仅附加了300万个专有名词?

    其次,假设这是一次合并,是否有可能对条目进行重新加权,以更强烈地选择普通的unidic条目?一、 e.我很想把±¨和SMAP分别识别为单个专有名词,但我也需要它明白,它总是意味着“地点”(当然,除非它后面跟着一个名称后缀,例如或§)。

    unidic-neologd

    1 回复  |  直到 9 年前
        1
  •  2
  •   polm23    9 年前

    Neologd与unidic(或ipadic)合并,这就是它在名称中保留“unidic”的原因。如果一个条目有多个词性,例如,通过使用词性转换最小化整个句子的成本,以及对于词典中的单词,每个标记的成本来选择要使用的条目。

    場所,4786,4786,4329,名詞,固有名詞,一般,*,*,*,バショ,場所,場所,バショ,場所,バショ,固,*,*,*,*                              
    場所,4790,4790,4329,名詞,固有名詞,人名,姓,*,*,バショ,場所,場所,バショ,場所,バショ,固,*,*,*,*
    

    lex.csv ,默认unidic字典:

    場所,5145,5145,4193,名詞,普通名詞,一般,*,*,*,バショ,場所,場所,バショ,場所,バショ,混,*,*,*,*
    

    第四列是成本。更容易选择成本较低的项目,因此在这种情况下,您可以将成本作为专有名词提高,尽管老实说,我只会删除它。你可以阅读更多关于篡改成本的内容 here

    如果您想更强烈地加权所有默认unidic条目,可以修改neolog CSV文件以增加所有权重。这是创建这样的文件的一种方法:

    awk -F, 'BEGIN{OFS=FS}{$4 = $4 * 100; print $0}' neolog.csv > neolog.fix.csv
    

    在构建之前,您必须删除原始csv文件(请参阅下面的注释2)。


    お店の場所知っている?
    

    注2:neologd字典与默认unidic字典的结合方式基于Mecab字典构建工作的微妙方面。明确地 全部的 创建系统词典时,使用词典构建目录中的CSV文件。由于没有指定顺序,因此不清楚在发生碰撞的情况下会发生什么。

    here (日语)。