代码之家  ›  专栏  ›  技术社区  ›  Jeffrey04 George

使用PHP(XPath)、PHP/Python(Regexp)或Python(XPath)从html中提取信息

  •  1
  • Jeffrey04 George  · 技术社区  · 17 年前

    好奇的是,使用regexp(PHP/Python)比使用Python的XPath库快吗?Python的Xpath库通常比PHP的对应库快吗?

    3 回复  |  直到 17 年前
        1
  •  3
  •   Srikanth    17 年前

    如果速度是一项要求,请查看 lxml libxml2 和 libxslt C库。使用C库比任何纯php或python版本都要快得多。

    benchmarks 伊恩·比金:

    总之

    在开始这些基准测试之前,我知道lxml很快,但我没想到它会这么快。

    解析结果:

    Parsing Resutls http://1.2.3.9/bmi/blog.ianbicking.org/wp-content/uploads/images/parsing-results.png

        2
  •  2
  •   Gabriel Hurley    17 年前

    你可以给 Beautiful Soup

    根据我的主观经验,Python中的大多数比较操作都比PHP中的快。部分原因是Python是一种编译语言,而不是在运行时进行解释,部分原因是Python的贡献者为了提高效率而进行了优化。。。

    尽管如此,对于40k+文档,还是要找到一台速度很快的机器;-)

        3
  •  0
  •   whatnick    17 年前

    正如前一篇文章提到的,由于字节码编译(那些.pyc文件),Python通常比php快。而且许多DOM/SAX解析器在内部使用了相当多的regexp。那些告诉您使用regexp的人需要被告知它不是一个灵丹妙药。对于40k+文档,我建议使用新的多线程或经典线程并行化任务 parallel python .