代码之家  ›  专栏  ›  技术社区  ›  Rick

对于Python,如何在运行脚本之后获得页面输出?

  •  3
  • Rick  · 技术社区  · 15 年前

    3 回复  |  直到 15 年前
        1
  •  2
  •   Sergii Pozharov    15 年前

    有一个 Selenium.getHtmlSource() 方法,很可能它在Python中也可用。它以字符串形式返回当前页的源代码,因此您可以对其执行任何操作

        2
  •  3
  •   Corey Goldberg    12 年前

    使用 Selenium Web驱动程序 而Python,您只需访问 .page_source 属性获取当前页的源。

    例如,使用 Firefox() 司机:

    from selenium import webdriver
    
    
    driver = webdriver.Firefox()
    driver.get('http://www.example.com/')
    
    print(driver.page_source)
    
    driver.quit()
    
        3
  •  2
  •   Rick    15 年前

    你必须使用firefox才能工作。

    1) 创建一个新的firefox配置文件(不是必需的,但很理想,这样可以将其与正常的firefox使用分开),google上有很多关于如何做到这一点的信息,这取决于你的操作系统如何做到这一点

    2) 获取firefox插件: https://addons.mozilla.org/en-US/firefox/addon/2704/

    3) 然后只需启动selenium服务器就可以使用您创建的概要文件(下面是linux的一个示例)

    cd /root/Downloads/selenium-remote-control-1.0.3/selenium-server-1.0.3 
    java -jar selenium-server.jar -firefoxProfileTemplate /path_to_your_firefox_profile/
    

    也就是说,每当selenium访问一个给定的域名时,它会保存所有的页面,selenium也会创建一堆垃圾页面,这样你就可以通过简单的regex解析来删除这些页面,如何操作保存的页面取决于你