代码之家  ›  专栏  ›  技术社区  ›  Lumpy

搜索引擎如何查看动态配置文件?

  •  1
  • Lumpy  · 技术社区  · 16 年前

    最近,搜索引擎已经能够在社交网站上浏览动态内容。我想知道这是怎么做到的。是否有像Facebook这样的网站创建的半频繁更新的静态页面?谷歌是否尝试存储所有可能的用户名?

    据我所知,像www.facebook.com/username这样的页面不是存储在磁盘上的实际文件,而是像这样的查询的简写:从用户中选择用户名并在页面上显示信息。谷歌是如何知道每个用户的,当涉及到像tweets这样的事情时,这就变得更加复杂了。

    编辑: 我想我不是真的问我想知道什么。我需要像twitter或facebook那样大才能让google用特殊的方式对我的网站进行爬行吗?如果我允许任何人查看我的用户档案,谷歌会自动找到他们吗?如果不是的话,我该怎么做才行?

    3 回复  |  直到 14 年前
        1
  •  4
  •   LesterDove    16 年前

    特别是在tweets的情况下,谷歌并不是在传统意义上为他们“爬行”;他们已经 integrated with Twitter 实时提供搜索结果。

    在更一般的情况下,动态内容对Facebook或Twitter来说并不新鲜,尽管看起来可能是这样。谷歌搜索一个URL;该URL提供HTML数据;谷歌对其进行索引。无论是呈现页面的动态查询,还是静态HTML的缓存,对索引过程都没有什么影响。 理论上。 在实践中,还有很多东西(见下面迈克尔B的评论)。

    看看Vartec的简明扼要的帖子,关于谷歌如何在不登录和浏览FB的情况下找到所有的Facebook公开档案。

    好吧,这过于简单化了,但让我们看看人们还有什么要说的……

        2
  •  1
  •   Tesserex    16 年前

    据我所知,谷歌无法读取和存储个人资料的实际内容,因为谷歌机器人没有Facebook帐户,这将是一个巨大的隐私漏洞。

    这个机器人通过点击facebook.com,然后跟踪它能找到的每个链接来工作。无论它在点击的页面上看到什么内容,它都会存储。所以,即使它遵循一个动态的URL,比如www.facebook.com/username,它也只会记住它在访问时看到的一切。希望在这种特殊情况下, 不是 所述用户的所有私有数据。

    此外,Facebook可以并且确实提供搜索机器人可以遵循的特殊指令,这样谷歌的结果就不会包含大量的登录页面。

        3
  •  1
  •   vartec    16 年前
    1. 配置文件可以从外部链接;
    2. 站点可以提供站点地图
    推荐文章