|
|
1
3
你可以看看这个bookmarklet背后的算法, readability -它在所有网页垃圾中提取内容的成功率相当高。 我的朋友做到了,这就是我推荐它的原因——因为我知道它是有效的,而且我知道他使用了很多技术来分析数据。你可以根据自己的要求运用这些技巧。 |
|
|
2
2
您可以查看goose的源代码->它已经做了很多类似instapaper的文本提取 |
|
|
3
1
看看shuyo nakatani的extractcontent代码。 查看原始ruby源代码 http://rubyforge.org/projects/extractcontent/ 或者它的一个端口到Perl http://metacpan.org/pod/HTML::ExtractContent |
|
|
4
0
你真的应该考虑使用 HTML parser 为此。收集相似的页面并比较dom树以找到不同的节点。 |
|
|
5
0
这 article 提供不同方法的比较。Java文库 boilerpipe 评价很高。在样板文件网站上,你可以找到他的科学论文,与其他算法进行比较。 并非所有算法都适用于所有目的。这些工具的最大应用就是将原始文本作为搜索引擎进行索引。你不希望搜索结果被广告搞得一团糟。这样的抽取可能是破坏性的;这意味着它不会给你“最佳阅读区域”,这正是人们对Instapaper或可读性的要求。 |