代码之家  ›  专栏  ›  技术社区  ›  Arun Gowda

在google Vision OCR中识别为单个单词的特殊字符?

  •  1
  • Arun Gowda  · 技术社区  · 7 年前

    我试图让google vision OCR正则表达式可以搜索。我已经完成了它,当文档只包含英文字符时,它运行得非常好。但是当有其他语言的文本时,它就失败了。

    这是因为我在GoogleVisionWord组件中只有英文字符,如下所示。

    VISION_API_WORD_COUNTERS = "([a-zA-Z0-9]+)|([^a-zA-Z0-9 ])";
    VISION_API_WORD_COMPONENTS = "[a-zA-Z0-9]";
    VISION_API_NOT_WORD_COMPONENTS = "[^a-zA-Z0-9]";
    

    因为我不能包含所有语言的字符,所以我想包含上面的倒数。差不多

    VISION_API_WORD_COMPONENTS = "[^*ALL THE SPECIAL CHARACTERS WHICH ARE IDENTIFIED AS WORD BY GOOGLE VISION*]"
    

    例如 [^!@#$%^&*()_+=] .

    那我在哪里能找到 ?

    反复试验,不断添加我发现的特殊字符是一种选择。但那将是我最后的选择。

    0 回复  |  直到 7 年前