|
|
1
2
尝试 Simple HTML DOM Parser 但是呢? |
|
|
2
1
有一个很棒的 BeautifulSoup 在大多数情况下可以处理损坏标记的python模块。它还允许在页面格式错误导致其内置的启发式无法工作的情况下使用钩子对html进行预处理。我用beautifulsoup编写了几十个解析器。 还有 html5lib 该模块速度更快,还可以解析无效的HTML。 两个模块都有ruby端口。 |