lda_topic_matrix
包含文档属于特定主题/标记的概率分布在human中,这意味着每一行的总和为1,而每个索引处的值是该文档属于特定主题的概率。因此,每个文档都有不同程度的所有主题标记如果有4个主题,则所有标记都相等的文档将在
lda_主题矩阵
类似
[0.25, 0.25, 0.25, 0.25]
. 只有一个主题(“0”)的文档行将变成
[0.97, 0.01, 0.01, 0.01]
包含两个主题(“1”和“2”)的文档将具有如下分布
[0.01, 0.54, 0.44, 0.01]
因此,最简单的方法是选择概率最高的主题,并检查它是否
2
或
3
:
main_topic_of_document = np.argmax(lda_topic_matrix, axis=1)
tagged = ((main_topic_of_document==2) | (main_topic_of_document==3)).astype(np.int64)
This article
很好地解释了LDA的内部机理。