|
|
1
1
例如,你可以假设
因此,首先将标签转换为数字:
现在:
将标签转换为数字:
现在你可以使用
输出: {0: [0, 1, 2], 1: [3, 4]}
输出:
这是你的两个集群。 |
|
2
0
频繁项集 相反。 短的 一组词,每件事物通常只在几个层次上相连:没有共同点,一个共同点,两个共同点。这太粗糙了,无法用于集群。你会把所有的东西都连接起来,或者什么都不连接,结果可能对数据更改和排序非常敏感。 因此,我们放弃了对数据进行分区的模式,转而寻找频繁的组合。 |
|
|
3
-1
所以,在google了很多遍之后,我发现,事实上,我不能使用聚类技术,因为我缺少可以对单词进行聚类的特征变量。如果我做一个表格,其中我注意到每个单词与其他单词(事实上是笛卡尔积)一起存在的频率,实际上是邻接矩阵,聚类不能很好地处理它。 所以,我要寻找的解决方案是图形社区检测。我使用igraph库(或者python的python ipgraph包装器)来查找集群,它运行得非常好,速度非常快。
|
|
|
statnet22 · 在分类问题中,是否存在重新标记聚类的R函数? 2 年前 |