我在SO和其他论坛上做了很好的分析,我也看到了如何处理复数的解决方案,但这里是从excel传递单词的情况。
我有一个长长的关键字列表,我正在将该列表传递给我的regex,如下所示:
df = pd.read_excel('\\Keywords.xlsx', sheet_name=0)
keyword_list = df['Keyword_List'].tolist()
keywords_regex =(r'(({0})\b)'.format('|'.join(keyword_list)))
我必须保留
\b
最后因为我有句话
遇见
会议
我有一个巨大的文本段落,我想检查我的关键字列表中出现了多少单词,包括复数。所以,如果段落中包含“Boy”和“Boys”两个词,我希望两者都包含。目前,以下代码仅适用于单数:
matches = re.findall(keywords_regex, text, re.IGNORECASE) ## text is the long paragraph