selenium 爬取js生成的内容

selenium和phantomjs的介绍

selenium

Selenium是一个用于Web应用程序测试的工具。Selenium测试直接运行在浏览器中,就像真正的用户在操作一样。支持的浏览器包括IE(7, 8, 9, 10, 11),Mozilla Firefox,Safari,Google Chrome,Opera等主流浏览器。这个工具的主要功能包括:测试与浏览器的兼容性——测试你的应用程序看是否能够很好得工作在不同浏览器和操作系统之上。

它的功能有:

  1. 框架底层使用JavaScript模拟真实用户对浏览器进行操作。测试脚本执行时,浏览器自动按照脚本代码做出点击,输入,打开,验证等操作,就像真实用户所做的一样,从终端用户的角度测试应用程序。
  2. 使浏览器兼容性测试自动化成为可能,尽管在不同的浏览器上依然有细微的差别。
  3. 使用简单,可使用Java,Python等多种语言编写用例脚本

也就是说,它可以根据指令,做出像真实的人在访问浏览器一样的动作,比如打开网页,截图等功能。

phantomjs

(新版本的selenium已经开始弃用phantomjs, 不过有时候我们可以单独用它做一些事情)

是一个机遇Webkit的无界面浏览器,可以把网站内容加载到内存中并执行页面上的各种脚本(比如js)。

官网下载地址: http://phantomjs.org/download.html

安装

其实该软件是可以免安装的,Mac、linux、windows直接将可执行文件放入到环境变量目录即可。同时,如果配合selenium一起使用,创建浏览器对象的时候,可以直接通过参数指定文件路径即可。

br = webdriver.PhantomJS('./phantomjs.exe')
br.get('http://www.baidu.com')
br.save_screenshot('2.png')

selenium应用篇

安装

pip install selenium -i https://pypi.douban.com/simple/

如果需要正常驱动浏览器,比如chrome,那么我们需要安装相对应的驱动才能进行操作。我们可以去网上搜索驱动安装,也可以直接去淘宝的npm源中找到(http://npm.taobao.org),比如我们接下来要用的chromedriver,下载地址:https://npm.taobao.org/mirrors/chromedriver,一般这些下载的地方都会提供不同操作系统的版本的软件,选择对应系统的和浏览器对应的最新版本即可。Mac和Linux版本的下载解压后,将二进制可执行文件放到对应的环境变量目录即可(比如:/usr/local/bin)。windows版可以直接把chromedriver.exe放到要运行的python文件所在目录,也可以将chromedriver.exe的路径添加到环境变量path中。

快速上手

from selenium import webdriver
import time

# 获取一个浏览器对象
br = webdriver.Chrome()

# 打开一个页面
br.get('http://www.baidu.com')

# 获取页面的源代码(运行后在内存中渲染的页面元素)
print(br.page_source)


# 根据id查找元素
kw = br.find_element_by_id('kw')
# 往表单输入框中输入内容
kw.send_keys('你好')
# 点击某个元素
br.find_element_by_id('su').click()


time.sleep(3)
# 将页面内容保存成截图
br.save_screenshot('./1.png')

# 设置窗口最大化
br.maximize_window()
time.sleep(2)
# 指定浏览器窗口大小
br.set_window_size(1200, 800)

# 设置浏览器的坐标 四个参数分别是 x坐标 y坐标 窗口的宽 框框的高
br.set_window_rect(100, 200, 300, 500)


# 获取所有cookie
print(br.get_cookies())
print('*' * 10)
# 获取某一个cookie的信息
print(br.get_cookie('BDORZ'))


time.sleep(2)
# 关闭窗口
br.close()
# 退出浏览器
time.sleep(2)
br.quit()

元素对象操作

查找(定位)单个元素(查询符合条件的第一个元素)

# 根据类名查找元素
br.find_element_by_class_name('s_btn')

# 根据元素的name值查找元素
br.find_element_by_name('ie')

# 根据元素的标签名称查找元素
br.find_element_by_tag_name('div')

# 根据链接包裹着的文字查找
br.find_element_by_link_text('地图')

# 根据链接包裹着的部分文字查找
br.find_element_by_partial_link_text('地')

# 根据css选择器规则进行查找元素
br.find_element_by_css_selector('#wrapper')

# 根据xpath规则进行查找元素   xpatch插件需要浏览器下载
find_element_by_xpath('//*[@id="q"]')

多元素查找(定位)

所谓多元素查找其实就是查询符合规则的所有元素,使用方法上和单元素查找一样,只是方法名和返回值有所区别

方法名的区别:多元素是以find_elements开头的 ,单个元素是find_element开头的。

比如:

# 获取所有的a标签元素, 使用的时候可以遍历返回值使用
br.find_elements_by_tag_name('a')

获取元素对象的属性

元素对象.get_attribute('属性名')

获取元素对象的文本内容

元素对象.text

交互动作

页面元素的交互动作

我们前面在快速上手部分已经使用了几个交互动作了,比如send_keysclick 等,其实常用的还有clear(清空输入框的内容)

浏览器的属性和动作

除了快速上手部分我们看到的操作浏览器本身的属性和方法外,还有不少:

image

运行JavaScript

br.execute_script('alert(111)')

Frame

有些时候,我们的网页中会嵌入iframe,如果我们需要操作iframe里面的内容的话,就需要我们先切换的iframe

常用的方法有:switch_to.frame()switch_to.parent_frame()

等待

当使用了隐式等待执行测试的时候,如果WebDriver没有在DOM中找到元素,将继续等待,超出设定时间后则抛出找不到元素的异常, 换句话说,当查找元素或元素并没有立即出现的时候,隐式等待将等待一段时间再查找 DOM,默认的时间是0

隐式等待

到了一定的时间发现元素还没有加载,则继续等待我们指定的时间,如果超过了我们指定的时间还没有加载就会抛出异常,如果没有需要等待的时候就已经加载完毕就会立即执行。

br = webdriver.Chrome()
# 设置最长等待10秒
br.implicitly_wait(10)

显式等待 (选学)

指定一个等待条件,并且指定一个最长等待时间,会在这个时间内进行判断是否满足等待条件,如果成立就会立即返回,如果不成立,就会一直等待,直到等待你指定的最长等待时间,如果还是不满足,就会抛出异常,如果满足了就会正常返回

from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC

br = webdriver.Chrome()
br.get('https://www.taobao.com/')
wait = WebDriverWait(br, 10)
input = wait.until(EC.presence_of_element_located((By.ID, 'q')))
button = wait.until(EC.element_to_be_clickable((By.CSS_SELECTOR, '.btn-search')))
print(input, button)

上述的例子中的条件:EC.presence_of_element_located()是确认元素是否已经出现了
EC.element_to_be_clickable()是确认元素是否是可点击的

常用的判断条件:

title_is 标题是某内容

title_contains 标题包含某内容

presence_of_element_located 元素加载出,传入定位元组,如(By.ID, 'p')

visibility_of_element_located 元素可见,传入定位元组

visibility_of 可见,传入元素对象

presence_of_all_elements_located 所有元素加载出

text_to_be_present_in_element 某个元素文本包含某文字

text_to_be_present_in_element_value 某个元素值包含某文字

frame_to_be_available_and_switch_to_it frame加载并切换

invisibility_of_element_located 元素不可见

element_to_be_clickable 元素可点击

staleness_of 判断一个元素是否仍在DOM,可判断页面是否已经刷新

element_to_be_selected 元素可选择,传元素对象

element_located_to_be_selected 元素可选择,传入定位元组

element_selection_state_to_be 传入元素对象以及状态,相等返回True,否则返回False

element_located_selection_state_to_be 传入定位元组以及状态,相等返回True,否则返回False

alert_is_present 是否出现Alert

get_cookies()
get_cookie('键名')
delete_all_cookes()
delete_cookie(键名)
add_cookie({'name': 'name', 'domain': 'www.zhihu.com', 'value': 'zhaofan'})

选项卡管理

通过执行js命令实现新开选项卡window.open()
不同的选项卡是存在列表里br.window_handles
通过br.window_handles[0]就可以操作第一个选项卡

import time
from selenium import webdriver

browser = webdriver.Chrome()
browser.get('https://www.baidu.com')
browser.execute_script('window.open()')
print(browser.window_handles)
browser.switch_to_window(browser.window_handles[1])
browser.get('https://www.taobao.com')
time.sleep(1)
browser.switch_to_window(browser.window_handles[0])
browser.get('https://python.org')

chrome 无界面浏览器

我们在前面的学习中会发现,PhantomJS已经不被新版本的Selenium弃用了,同时我们前面一直使用的是有界面的浏览器,但是它运行的时候,很影响我们去干其它事情,不用怕,其实chrome和火狐都提供的有无界模式。只需要传入一些参数即可

from selenium import webdriver
from selenium.webdriver.chrome.options import Options

# 配置chrome的参数
options = Options()
options.add_argument('--headless')
# options.add_argument('--disable-gpu')

# 获取一个浏览器对象
br = webdriver.Chrome(chrome_options=options)

原文地址:https://www.cnblogs.com/tiaowangdeying/p/10491755.html

版权声明:本文内容由互联网用户自发贡献,该文观点与技术仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容, 请发送邮件至 dio@foxmail.com 举报,一经查实,本站将立刻删除。

相关推荐


转载地址:https://www.cnblogs.com/mini-monkey/p/12104821.html前言有时候测试过程中会遇到日期控件场景,这时候需要特殊处理,下文以12306网站为例1.处理方式通常是通过js去除只读属性(2种方法),然后通过send_keys重新写值fromtimeimportsleepdriver=webdriver.Chrome()dr
web自动化测试过程中页面截图相对比较简单,可以直接使用selenium自带的方法save_screenshot()。示例:对百度首页整个页面进行截图。#coding=utf-8fromseleniumimportwebdriverd=webdriver.Chrome()d.get('https://www.baidu.com/')#对页面进行截图d.save_screensh
目录前言一、Selenium简介二、浏览器驱动1.浏览器驱动参考2.Windows下载Chrome驱动三、代码实现1.新建控制台项目WeatherWebCrawler2.选择.NET6.03.安装NuGet包4.将下载好的驱动放到项目生成目录下5.编写代码四、完整代码总结前言提示:爬虫本身并不违法,所有爬虫都
一、iframe的含义:iframe是HTML中框架的一种形式,在对界面添加嵌套另一个页面时可以使用iframe。做ui自动化的时候,元素定位不到的一个很重要原因就是页面存在iframe。Iframe可以比喻成一道门,打开这道门才能进入屋子里。二、怎么判断页面上存在iframe?谷歌浏览器F12(或者右
转载请注明出处❤️作者:测试蔡坨坨原文链接:caituotuo.top/d59b986c.html你好,我是测试蔡坨坨。众所周知,Selenium在2021年10月13号发布了Selenium4,目前最新的版本应该是Selenium4.4.0。以前一直用的Selenium3,那么Selenium4相对Selenium3对我们做自动化测试来说有哪些需要注意的
'''##**认识selenium**​**下载:pipinstallselenium**​官方文档:https://selenium-python.readthedocs.io/###什么是selenium?​selenium是一套完整的web应用程序测试系统,包含了测试的录制(seleniumIDE),编写及运行(SeleniumRemoteControl)和测试的并行处理(SeleniumGr
importtimefromselenium.webdriver.support.waitimportWebDriverWaitfromseleniumimportwebdriverfromselenium.webdriver.common.byimportBydriver=webdriver.Chrome(r"D:\百分浏览器\CentBrowser\Application\chromedriver.exe");driver.get("htt
前言:当鼠标悬停在隐藏文本内容上时,显示所有内容。场景案例:百度首页,要选择‘高级搜索’,先得把鼠标放在‘设置上’F12-在页面中搜索‘高级搜索’,找到‘高级搜索’文本,鼠标放到‘设置’上,display的值变为block;鼠标不放上去之前是none,即不可见元素。隐藏的元素操作,会出现报
selenium中的ActionChains初始化时传入driverActionChains中存储的所有行为click(on_element=None)——单击鼠标左键click_and_hold(on_element=None)——点击鼠标左键,不松开context_click(on_element=None)——点击鼠标右键double_click(on_element=None)——双击鼠标
介绍常见的表单元素 Input,button,checkbox,select。表单使用表单标签(<form>)定义。例如:<form><input/></form> 保存HTML到本地进行操作<!DOCTYPEhtml><htmllang="en"><head><metacharset="UTF-8"><title&g
1、处理定位报错的问题判断该元素存在,再输入。判断该元素不存在,抛出异常。依然是通过EC这个模块。2、判断是否存在邮箱地址,存在,再操作。就不用担心元素不存在,程序报错。3、判断传入的元素是否可见,是否在显示范围内。还是要先找元素但这样找,只能顺利的执行一次。fr
1、使用国内的镜像地址https:/egistry.npmmirror.com/binary.html?path=chromedriver/ 2、通过simulation模拟用户点击来下载(只贴出部分方法)#!/usr/bin/envpython#-*-coding:utf-8-*-importosimportplatformimportsignalimporttimeimportallureimport
案例描述https://www.healthsmart.com.hk/hs-home/#!/link/home这个网页你手工打开的时候你会发现一直处于加载中,一定时间后才好。我们的需求是点击会员,弹出菜单,进行下一步操作,如果没有加载好是点不了的(业务特点)。我们来看看代码怎么写示例代码1:时间去哪里了fromselen
  分析了好几个小时淘宝的登陆,对其反爬虫方案有了点思路,先记录一下,后面会持续进行分析。当然想要玩更高级的Python爬虫首先你要把基础打牢,这里小编准备了一份Python爬虫入门资料,进群:700341555即可免费领取!  众所周知目前使用selenium打开浏览器访问淘宝,不管你是手动
在python+selenium中经常会遇到找到的元素不唯一,导致定位到的元素不是预期的或者定位不到元素解决方法:只要在页面进行确认找到的元素唯一后,再进行操作 页面确认方法:1、通过html中检索功能确认进入开发者模式:点击右上角三个点-->选则search进行查找或
引入       使用Scrapy框架爬取某些网站的数据时,往往会页面动态加载数据的情况。如果是直接使用Scrapy对其url发起请求,是绝对获取不到动态加载的数据的。但是通过观察我们会发现,通过浏览器对其url发起请求则会加载出对应的动态数据。那么,如果我们想要在Scrapy中获取
孤荷凌寒自学python第八十五天配置selenium并进行模拟浏览器操作1 (完整学习过程屏幕记录视频地址在文末) 要模拟进行浏览器操作,只用requests是不行的,因此今天了解到有专门的解决方案:selenium模块及与火狐浏览器的配合使用。一、环境配置(一)、安装selenium模块pipinstallse
selenium确认进入了预期页面在自动化操作中,浏览器每次进入一个新的需要,都需要确认该页面是否打开或打开的页面是否是预期的页面需要进行确认页面后方可进行下一步操作确认页面有很多中方法,像笔者所在项目的中每个页面都有一个固定属性(ng-page=‘xxx’)来确认,所以确认页面的时候