|
|
1
12
我的2美分。鉴于translate.google.com是一个统计机器翻译引擎,以及a Halevy、P Norvig(谷歌研究总监)和;F佩雷拉: 我假设 (打赌)这是一个 统计驱动的拼写检查器 . suffix arrays 例如,如果你必须计算 n-grams 子集),其跟踪n元语法数量的计数(估计概率)。 例如,如果你的语料库只由以下部分组成:
根据此条目,您将生成以下双字图(2个单词的集合):
以及三元组(3个单词的集合):
但它们将通过统计相关性测试进行修剪,例如:我们可以假设三元组
将从短语表中消失。 现在,拼写检查只会查看这个大短语表并检查“概率”。(你需要一个良好的基础设施来将这个短语表存储在高效的数据结构和RAM中,谷歌有translate.Google.com,为什么不呢?这比统计机器翻译更容易。) 例如:您键入
短语表中有一个
这只是我的假设意见。 ;) |
|
|
2
1
您还应该观看Google Wave团队Casey Whitelaw的官方视频,该视频描述了所使用的技术: http://www.youtube.com/watch?v=Sx3Fpw0XCXk |
|
|
3
1
你可以通过深入自然语言处理来学习所有关于这样的主题。你甚至可以深入到统计猜测,在给定的单词串之后,下一个单词会是哪个。
|
|
|
4
1
关于这个问题有很多论文。这里有一些很好的资源 这没有使用上下文敏感性,但它是一个很好的构建基础 http://norvig.com/spell-correct.html http://acl.ldc.upenn.edu/acl2004/emnlp/pdf/Cucerzan.pdf 从这里你可以深入了解细节。我建议使用谷歌学者,查找上面论文中的参考文献,并搜索“拼写纠正” |