|
|
1
3
好吧,我会按照你描述的方式去做。 它将处理多少数据?通过WebClient/HttpWebRequest获取完整HTML应该不是问题。 2. 我会选择 HtmlAgilityPack 用于HTML解析。这是非常宽容的,可以处理漂亮丑陋的标记。由于HtmlAgilityPack支持XPath,因此很容易为各个站点选择特定的XPath。 我正在逃亡,并将尽快对这个答案进行扩展。 |
|
|
2
1
strategy pattern . 您可以使用反射或类似的方式加载每个站点的策略。 我曾在一个系统上工作过,该系统使用XML定义一组通用参数,用于从HTML页面提取文本。基本上,它将定义开始和结束提取的开始和结束元素。我发现这项技术对于一个小样本来说已经足够好了,但是随着网站集合越来越大,它变得相当麻烦,而且很难定制。使XML保持最新,并尝试保持一组通用的XML和代码来处理任何类型的站点都是困难的。但是,如果站点的类型和数量很小,那么这可能会起作用。 pipeline 如果您认为该领域足够复杂,可以保证它的存在,那么这将是一个很好的方法。但是,即使只是一个在解析HTML之前在HTML上运行一些正则表达式的方法也是有价值的。摆脱图像,用更好的HTML替换误用的标签,等等。大量的真正不可靠的HTML仍然让我惊讶。。。 |
|
|
NoUsername9 · 使用Apify和Puppeter抓取URL 6 年前 |
|
|
Alok Mishra · 如何自动点击“内容”按钮 8 年前 |
|
|
Ike · Python Selenium错误-当webdriver 8 年前 |
|
|
ilyas · 使用网站查询获取数据[已关闭] 8 年前 |