|
1
2
我不知道C,但我确信它有一些宽泛的HTML DOM解析器-宽泛的,因为它可以在一半的时候正确地处理自结束或非结束标记。 我想除了把树和这样一个库放在一起,扔掉任何不符合 valid XHTML tags list 把它重新包装成一根绳子。 |
|
|
2
0
是的,我就是这么做的。使用htmlagilityPack。( http://htmlagilitypack.codeplex.com/ ) 这似乎有点太简单了,让我觉得我忽略了它可能存在的问题,但下面是代码:
如果你认为这有什么问题,请告诉我。我所处理的HTML总是有结束标记,并且(相对而言)格式良好,因为它是通过另一家公司在将其存储到数据库之前编写的自定义HTML检查器进行的。所以我不确定如何处理格式不正确的HTML。 感谢Pekka建议采用“搜索和销毁”方法。 |