代码之家  ›  专栏  ›  技术社区  ›  Max Strini

分析松散/古怪/几乎结构化数据的背景阅读?

  •  3
  • Max Strini  · 技术社区  · 17 年前

    由于有相当数量的现有商业产品做相关的事情(“网络浏览器中的怪癖模式、编译器中的错误解释,甚至自然语言处理和数据挖掘等”),我相信一些聪明人已经考虑到了这一点,并试图发展一种理论,那么,以尽可能有原则的方式解析无原则数据的背景阅读的最佳来源是什么?

    我意识到这有点开放性,但我的问题是,我想我需要更多的背景知识,甚至知道应该问什么问题。

    1 回复  |  直到 15 年前
        1
  •  1
  •   Jason D Elon Zito    16 年前

    考虑到你的建议和用生牛肉味的果酱和双手绑在背后对抗饥饿的鳄鱼之间的选择,我会选择。。。

    好吧,更严肃地说,如果你有不符合任何“理智”结构的数据,你必须研究数据,找出其中怪癖的频率,并将给定上下文的数据关联起来(即它是如何生成的)

    打印到OCR以获取数据几乎总是会导致心碎。我工作的公司雇佣了一支名副其实的大军,他们手动阅读此类文档,并手动“编码”(即手动输入)已知有问题的OCR场景的数据,或我们的客户检测到原始OCR失败的文档。

    如果有任何可能获取原始数据文件的方法,请务必这样做。或者,如果您可以要求提供数据的人以一种定义良好的格式提供数据,甚至更好。(它可能不是“您的”格式,但至少是一种您可以转换的常规和可预测的格式)