代码之家  ›  专栏  ›  技术社区  ›  Chris Lloyd

OCR的理想字体是什么?

  •  27
  • Chris Lloyd  · 技术社区  · 17 年前

    有没有人对OCR的不同字体有经验?我正在生成一个ID,然后尝试用Tesseract扫描它。目前,我只是使用不同的字体,但这似乎效率很低。我尝试过OCR*字体系列,以及各种其他字体,如Arial和Georgia。Tesseract倾向于与OCR*字体混淆。

    有没有专门为Tesseract设计的字体,或者任何与之配合良好的系统字体?

    7 回复  |  直到 8 年前
        1
  •  16
  •   Paul Sonier    17 年前

    好的,在谷歌上搜索就会发现这个,一个特定的OCR字体: OCR Font

    看起来这是1973年采用的标准。

        2
  •  12
  •   Gawin    9 年前

    在尝试了很多不同的字体和 光学字符识别引擎 我倾向于使用 Consolas . 这是一个 等宽的 像OCR-A一样的字体,但是 易于阅读 为人类。consolas包含在多个Microsoft产品中。

    还有一个 开放源代码 字体 Inconsolata ,这就是 受影响 康索拉斯。英科索拉塔是一个很好的替代安慰,特别是考虑到许可细节。

    在我的测试中, Calibri 字体不总是被正确识别。OCR-A有很多读取错误。我没有尝试过MIRC,因为它对大多数人来说不容易阅读。

    注释 :Tesseract在可靠之前需要大量测试和微调。在我们的例子中,我们切换到了商业许可的OCR引擎(ABBYY),特别是因为可靠性非常重要,我们需要支持多种(欧洲)语言。

    更新: 2017年1月31日-更改' 基于consolas “to” 受consolas影响 '由于潜在的版权问题。

        3
  •  5
  •   Chris    16 年前

    我发现Calibri最适合我。我们每天在自动化系统中使用OCR软件,并且在测试了数十种Calibri一贯最佳的字体(包括一些特定于OCR的字体)之后。

    祝你好运。

        4
  •  4
  •   benjismith    17 年前

    我可能会使用与银行在支票底部的银行代号相同的字体:

    http://morovia.com/font/micr.asp

    它是专门设计为明确的机器可读。

        5
  •  2
  •   David    17 年前

    我总是通过简单地使用Times New Roman获得成功。

        6
  •  1
  •   Glen Murie    8 年前

    我最近在一个名为laserfiche的ECM中做了大量的测试,它使用Nuance Omnipage,我发现单空间字体与动态间隔字体相比表现不佳。那些旧的OCR字体的性能不如普通字体好。尤其是对于字体较小的数字字符串,如第12点。

    奇怪的是,有人在Calibri上取得了成功。它在我的测试中表现很差,经常会让相似点的字母和数字相互混淆。最好的字体(安装了Office的Windows计算机上的字体)是consolas、verdana和book antiqua。所有动态衬线字体的字母和数字看起来都很明显。康索拉斯是冠军。

        7
  •  0
  •   Sam    10 年前

    目前正在使用单空间。尝试了很多字体,但这是我最准确的。