代码之家  ›  专栏  ›  技术社区  ›  fifigyuri

是否存在任何开放的、简单可扩展的网络爬虫?

  •  7
  • fifigyuri  · 技术社区  · 16 年前

    我寻找一个网络爬虫解决方案,它可以足够成熟,可以简单地扩展。我对以下功能感兴趣…或扩展爬虫以满足它们的可能性:

    • 部分只是为了阅读几个网站的提要
    • 废弃这些网站的内容
    • 如果站点有存档,我也要对其进行爬网和索引
    • 爬虫应该能够为我探索部分网站,它应该能够决定哪些网站符合给定的标准。
    • 如果发现可能符合我兴趣的东西,应该能通知我
    • 爬虫不应该通过过多的请求攻击服务器来杀死服务器,它应该聪明地进行爬行。
    • 爬虫应该对异常的站点和服务器有强大的抵抗力。

    以上这些事情可以一个接一个地完成,而不需要付出任何努力,但我对任何提供可定制、可扩展爬虫程序的解决方案都感兴趣。我听说过阿帕奇·纳奇,但到目前为止对这个项目还不确定。你有这方面的经验吗?你能推荐替代品吗?

    4 回复  |  直到 13 年前
        1
  •  2
  •   Joseph Salisbury    16 年前

    快速搜索 GitHub 呕吐 Anemone 这是一个Web蜘蛛框架,它似乎符合您的需求——尤其是可扩展性。用红宝石写的。
    希望一切顺利!

        2
  •  4
  •   kkrugler    16 年前

    当我为克鲁格的初创公司构建开源项目索引时,我已经广泛使用了nutch。很难定制,这是一个相当单一的设计。有一个插件架构,但是插件和系统之间的交互是复杂和脆弱的。

    由于这种经验,并且需要更灵活的东西,我开始了Bixo项目——一个Web挖掘工具包。 http://openbixo.org .

    是否适合你取决于以下因素的权重:

    1. 你需要多少灵活性(+)
    2. 它应该多成熟(-)
    3. 是否需要缩放能力(+)
    4. 如果您对Java/Hadoop(+)感到满意
        3
  •  2
  •   Vinko Vrsalovic    16 年前

    我衷心推荐 heritrix . 它非常灵活,我认为它是最经过战斗测试的免费开放源码爬虫,因为它是互联网档案馆使用的。

        4
  •  2
  •   Kane    16 年前

    你应该能找到符合你需要的东西 here .

    推荐文章