|
|
1
15
删除多余字符
用法:
用法:
常用昵称: this list 并将其用于连接通用名称等效项。 用法:
语音算法(Jaro Winkler): 这篇精彩的文章, Beyond SoundEx - Functions for Fuzzy Searching in MS SQL Server ,显示如何安装和使用 SimMetrics Jaro Winkler 匹配名称。 用法:
|
|
2
2
这是一个非常复杂的问题,而且有很多昂贵的工具来正确地完成它。
(1) 穆阿迈尔·卡扎菲
这只是官方拼写,不包括拼写错误! |
|
|
3
1
对于这种情况,我经常使用soundex类型的算法。试试 Double Metaphone 算法。如果您使用的是SQL Server,则有一些源代码可用于创建用户定义的函数。 因为您已经转置了数据,所以可能需要对其进行一点规范化,例如,删除所有逗号并按第一个字母对结果字进行排序。这将给你一些更好的匹配潜力。在中间添加了单词的情况下,它变得更难了。你可以考虑把名字分解成单词,用双隐喻检查是否有一个单词在另一个列中匹配,然后收集匹配项与单词的总体计数,这将告诉你这两个列有多接近。 在进行比较之前,我还会过滤掉常见的单词,如Dr.,Mr.,Ms.,Mrs.,等等。 |
|
|
4
1
语音算法。。。 Soundex( http://en.wikipedia.org/wiki/Soundex ) http://en.wikipedia.org/wiki/Double_Metaphone 编辑距离( http://en.wikipedia.org/wiki/Levenshtein_distance 雅罗-温克勒距离( http://en.wikipedia.org/wiki/Jaro-Winkler_distance ) 你可以尝试的另一件事是将每个单词(空格分隔,可能连字符)与另一个名字中的每个单词进行比较,看看有多少单词匹配。也许可以结合语音算法进行更多的模糊匹配。对于一个庞大的数据集,您可能需要索引每个单词并将其与名称id匹配。对于缩写匹配,您可以只比较第一个字母。当你比较单词时,你可能想忽略除了字母以外的任何东西。 许多语音算法都有在线开源/示例。 |
|
|
5
1
|