|
|
1
1
考虑到你的建议和用生牛肉味的果酱和双手绑在背后对抗饥饿的鳄鱼之间的选择,我会选择。。。 好吧,更严肃地说,如果你有不符合任何“理智”结构的数据,你必须研究数据,找出其中怪癖的频率,并将给定上下文的数据关联起来(即它是如何生成的) 打印到OCR以获取数据几乎总是会导致心碎。我工作的公司雇佣了一支名副其实的大军,他们手动阅读此类文档,并手动“编码”(即手动输入)已知有问题的OCR场景的数据,或我们的客户检测到原始OCR失败的文档。
如果有任何可能获取原始数据文件的方法,请务必这样做。或者,如果您可以要求提供数据的人以一种定义良好的格式提供数据,甚至更好。(它可能不是“您的”格式,但至少是一种您可以转换的常规和可预测的格式) |
|
|
Hackerds · 在正则表达式中捕获多个组不会返回任何结果 8 年前 |
|
|
BARIK FATI · 如何构建hashtags语料库(文本挖掘) 8 年前 |
|
|
Max TC · 在R中匹配并替换字符串中拼写错误的单词 8 年前 |
|
|
Bhavya · 从R中的dtm中按每个文档的频率提取顶部特征 8 年前 |
|
|
FF0605 · 如何在python中将多个句子转换为二元图 8 年前 |
|
|
Ravindra Nadh · twitter用户名的R正则表达式 9 年前 |