|
|
1
1
检查O'Reilly的集群概念 "Programming Collective Intelligence" . |
|
|
2
0
似乎建立这种关系的数据最有可能的方法是编目哪些标记最常出现在一起,而哪些标记与最少的其他标记一起出现。 也就是说,“C++”和“STL”出现在一起,而“STL”很少出现(?)没有“C++”出现,所以它们是相关的(至少在一个方向)。“C++”和“算法”也出现在一起,但它们更频繁地出现分离,因此它们不相关。 |
|
|
3
0
在考虑如何构造数据时,我的一个想法可能是一个四表系统。一个表是源数据(例如,必须有某种类型的问题表),它连接到一个标记表,然后是一个标记权重表,它连接回标记表。
我不知道这种结构有多有效,但我想应该是有办法的。否则,要使其正常工作,新的源数据入院可能会触发后更新触发器,或者让后台的工作进程在预设时间重新平衡权重。 |
|
|
4
-2
你需要一个好的搜索引擎。;) 自己动手:实现一种相似性算法。例如: Levenshtein distance 或 Dice's coefficient . 或者用一些现成的东西,比如 Lucene . |