代码之家  ›  专栏  ›  技术社区  ›  Chris Adragna

使用什么逻辑将多个人实体汇总/合并为同一个人实体?(紧密,但模糊程度足以扩大匹配范围)

  •  0
  • Chris Adragna  · 技术社区  · 15 年前

    我有多个人物实体的实例,它们通常是同一个人的多次。如果同一地址上的前一个和后一个地址相同,那么合并/汇总它们是不需要动脑筋的。

    然而,由于数据输入的不一致性,必须有一种方法来偏离准确性。我认为信用卡行业有点这样做:邮政编码加上街道号码,或者街道名称。。。这种性质的东西。

    我需要的东西,仍然会使匹配的记录,看起来很明显,一个人只要看一眼,但没有完全匹配的数据。

    以下是我最初的想法,连接由以下内容组成的字符串:

    First Initial
    LEFT8 of the LastName (allows inconsistent endings, such as "Esq." or "CPA")
    LEFT3 of Zip
    Street Number
    LEFT8 of the StreetName (not Addr1 -- "Oak" for "8 N Oak Street")
    

    我错过什么了吗?我认为我把它做得足够宽松,以克服正常的数据输入不一致,但足够紧凑,以避免不正确的匹配。

    2 回复  |  直到 10 年前
        1
  •  1
  •   Chris Walton    15 年前

    通过参考(英国)邮政编码、门牌号和/或姓名,确实可以进行大量数据清理。在英国,通过考虑邮政编码的第一部分可以引入模糊性,这决定了一个广泛的领域。我不清楚这是否适用于邮政编码。

    然而,这种方法不能很好地处理超出正常运行范围的地址——我自己的地址就是一个例子;我住在船上,因此有一些额外的地址,以确保正确的地址。

        2
  •  1
  •   Matt    14 年前

    Chris A.,您是否考虑过在这项任务中使用官方专家系统?值得注意的是,正如您所发现的,标准化地址以便有效地遍历它们变得非常困难。在 SmartyStreets (在我工作的地方),这是我们的业务核心:实现完成这项任务的某些算法。

    这可能不是一个好消息 直接的

    所以我建议首先 真正地 CASS-Certified Scrubbing ; 研究你自己的选择)。一个好的将为您标记重复项,然后让您采取行动。在地址被规范化和标记之后,您可以根据您的企业定义(通过姓氏等)更快地清除完全相同的地址。在这一点上,你会对任何东西进行模糊搜索 除了