代码之家  ›  专栏  ›  技术社区  ›  Ande Turner

特定上下文拼写引擎

  •  2
  • Ande Turner  · 技术社区  · 17 年前

    我以前没有见过这种技术,但在其他地方有这样的例子吗?

    4 回复  |  直到 17 年前
        1
  •  12
  •   SnippyHolloW    17 年前

    我的2美分。鉴于translate.google.com是一个统计机器翻译引擎,以及a Halevy、P Norvig(谷歌研究总监)和;F佩雷拉: 我假设 (打赌)这是一个 统计驱动的拼写检查器 .

    suffix arrays 例如,如果你必须计算 n-grams 子集),其跟踪n元语法数量的计数(估计概率)。

    例如,如果你的语料库只由以下部分组成:

    I had bean soup last diner.
    

    根据此条目,您将生成以下双字图(2个单词的集合):

    I had, had bean, bean soup, soup last, last diner
    

    以及三元组(3个单词的集合):

    I had bean, had bean soup, bean soup last, soup last diner 
    

    但它们将通过统计相关性测试进行修剪,例如:我们可以假设三元组

    I had bean 
    

    将从短语表中消失。

    现在,拼写检查只会查看这个大短语表并检查“概率”。(你需要一个良好的基础设施来将这个短语表存储在高效的数据结构和RAM中,谷歌有translate.Google.com,为什么不呢?这比统计机器翻译更容易。)

    例如:您键入

    I had been soup
    

    短语表中有一个

    had bean soup
    

    这只是我的假设意见。 ;)

        2
  •  1
  •   user124642 user124642    17 年前

    您还应该观看Google Wave团队Casey Whitelaw的官方视频,该视频描述了所使用的技术: http://www.youtube.com/watch?v=Sx3Fpw0XCXk

        3
  •  1
  •   San Jacinto    17 年前

    你可以通过深入自然语言处理来学习所有关于这样的主题。你甚至可以深入到统计猜测,在给定的单词串之后,下一个单词会是哪个。

        4
  •  1
  •   jshen    16 年前

    关于这个问题有很多论文。这里有一些很好的资源

    这没有使用上下文敏感性,但它是一个很好的构建基础 http://norvig.com/spell-correct.html

    http://acl.ldc.upenn.edu/acl2004/emnlp/pdf/Cucerzan.pdf

    从这里你可以深入了解细节。我建议使用谷歌学者,查找上面论文中的参考文献,并搜索“拼写纠正”

    推荐文章