|
0
|
| Chris Adragna · 技术社区 · 15 年前 |
|
|
1
1
通过参考(英国)邮政编码、门牌号和/或姓名,确实可以进行大量数据清理。在英国,通过考虑邮政编码的第一部分可以引入模糊性,这决定了一个广泛的领域。我不清楚这是否适用于邮政编码。 然而,这种方法不能很好地处理超出正常运行范围的地址——我自己的地址就是一个例子;我住在船上,因此有一些额外的地址,以确保正确的地址。
|
|
|
2
1
Chris A.,您是否考虑过在这项任务中使用官方专家系统?值得注意的是,正如您所发现的,标准化地址以便有效地遍历它们变得非常困难。在 SmartyStreets (在我工作的地方),这是我们的业务核心:实现完成这项任务的某些算法。 这可能不是一个好消息 直接的 所以我建议首先 真正地 CASS-Certified Scrubbing ; 研究你自己的选择)。一个好的将为您标记重复项,然后让您采取行动。在地址被规范化和标记之后,您可以根据您的企业定义(通过姓氏等)更快地清除完全相同的地址。在这一点上,你会对任何东西进行模糊搜索 除了 |
|
|
Johnny T · 基于当前值的SQL合并表[重复] 1 年前 |
|
John D · 需要为NULL或NOT NULL的WHERE子句 1 年前 |
|
ojek · 如何对SQL结果进行分组和编号? 1 年前 |
|
|
senek · 如何在PL/SQL中将选择结果(列)放入数组中 1 年前 |
|
|
Sax · 规范化Google表格(第一步) 1 年前 |
|
|
Jatin · 检索卷计数的动态sql抛出错误语法错误[关闭] 1 年前 |
|
|
Andrus · 如何在sql中查找第二个匹配项 1 年前 |