|
|
1
26
|
|
|
2
6
使用 HtmlUnit 这也是一种可能性。
|
|
|
3
4
Selenium现在封装了htmlunit,所以你不需要再启动浏览器了。新的WebDriver api也非常易于使用。 The first example use htmlunit driver |
|
|
4
2
很难编写一个适用于任何任意网站的解决方案。每个导航菜单的实现都可能非常独特。我用刮刀做了很多工作,如果你知道你想瞄准的网站,我会这样做。 通常,如果你分析导航菜单中使用的特定javascript,使用正则表达式提取用于构建导航菜单的整个变量集是相当容易的。我从未使用过Beautiful Soup,但从你的描述来看,它可能只适用于HTML元素,无法在脚本标签内工作。 如果您仍然有问题,或者需要模拟某种形式的POST或ajax,请获取Firefox并安装 LiveHttpHeaders 插件。此插件将允许您手动浏览网站,并捕获正在导航的网址以及在手动浏览过程中传递的任何Cookie。这就是您需要您的scraperbot发送请求以从目标Web服务器获得有效响应的原因。这也将捕获正在进行的任何ajax调用,在许多情况下,必须在您的scraper中实现相同的ajax调用才能获得所需的响应。 |
|
|
6
2
请记住,javascript的狂热会扰乱浏览器的页面内部DOM模型,对原始HTML没有任何影响。 |
|
|
7
1
我一直在使用Selenium,它发现它效果很好。 Selenium在浏览器中运行,可与Firefox、Webkit和IE配合使用。 http://selenium.openqa.org/ |
|
|
8
1
@insin Watir不仅仅是IE。 |
|
|
9
1
|
|
|
NoUsername9 · 使用Apify和Puppeter抓取URL 6 年前 |
|
|
Alok Mishra · 如何自动点击“内容”按钮 8 年前 |
|
|
Ike · Python Selenium错误-当webdriver 8 年前 |
|
|
ilyas · 使用网站查询获取数据[已关闭] 8 年前 |