代码之家  ›  专栏  ›  技术社区  ›  manofone

Adobe Acrobat/Python PDF输出各不相同

  •  1
  • manofone  · 技术社区  · 8 年前

    我注意到,当我使用OCR将扫描的PDF文档转换为文本时,在本例中是Adobe Acrobat Pro,根据我提取数据的方式,我会得到非常不同的输出。

    enter image description here

    在上面的照片中,你可以看到一张PDF文件,它已经被OCR处理成了质量相当好的文本。如果我在Adobe中选择它并将其复制为word或txt文档,它会粘贴得非常好。

    enter image description here

    然而,如果我使用Adobe将其导出为富文本格式,使用Python的PDFminer或Python的Apache Tika,那么我会得到上面的照片,正如您所看到的那样,这张照片完全混淆了它。两种方法的提取结果非常一致——基本上所有3种方法都以完全相同的方式将其混淆。

    你们有谁知道为什么OCR的PDF可以很好地复制到文本编辑器中,但却以如此奇怪的方式提取?

    非常感谢。

    当做 马诺

    1 回复  |  直到 8 年前
        1
  •  0
  •   manofone    8 年前

    因此,最终对我起作用的是使用Apache Tika运行初始解析,然后,在少数不起作用的情况下,将它们传递给 PyPDF2 . 我的理论是,PyPDF2使用不同的解析机制,与Tika不同,它不依赖PDF的根,这似乎是一些OCR文档中损坏的部分。

    不确定最初的原因,但这是我的解决方案。