代码之家  ›  专栏  ›  技术社区  ›  Andy Baker

用Python解析HTML[关闭]

  •  28
  • Andy Baker  · 技术社区  · 17 年前

    我更希望它能有点格式错误的HTML,尽管我很确定大多数输入都会非常干净。

    6 回复  |  直到 17 年前
        1
  •  10
  •   Andrei Taranchenko    6 年前

    native HTML parser 然而,尼克建议的整洁的包装可能也是一个不错的选择。Tidy是一个非常常见的库(是用C写的吗?)

        2
  •  2
  •   Nick Presta    17 年前

    可能 µTidylib 能满足你的需要吗?

        3
  •  2
  •   Gussisaurio    14 年前

    您可以使用托盘在Mac(OS X)上轻松无缝地安装lxml和许多其他python模块,托盘是 MacPorts official GUI

    模块名为py27 lxml。简单到1,2,3。

        4
  •  1
  •   Joe Bane    17 年前

    http://www.xmlhack.com/read.php?item=1392 http://sourceforge.net/projects/pirxx/

    http://pyxml.sourceforge.net/topics/

    我对python没有太多经验,但我在过去使用过Xerces(来自Apache基金会),发现它非常有用。学习曲线也不错,尽管我不是从python的角度来看的。不过我建议你考虑一下。(我包含的前两个链接讨论了Xerces的python接口,最后一个链接是google第一次点击“python xml”)。

        5
  •  1
  •   seagulf    15 年前

    htql擅长处理格式错误的html:

    http://htql.net/

        6
  •  1
  •   Shatu    8 年前


    http://code.google.com/p/html5lib/

    更新: 上面的链接断了。上述第三方镜像,可从 https://github.com/html5lib/gcode-import