python爬虫Selenium库详细教程
在我们爬取网页过程中,经常发现我们想要取得的数据并不能简单的通过解析HTML代码获取,这些数据是通过AJAX异步加载方式或者经过JS渲染后才呈现在页面上显示出来。
selenuim是一种自动化测试工具,它支持多种浏览器。而在爬虫中,我们可以使用它来模拟浏览器浏览页面,进而处理JavaScript渲染的问题。
本人对于Python学习创立了一个小小的学习圈子,为各位提供了一个平台,大家一起来探讨学习Python。欢迎各位到来Python学习群:696541369 一起探讨视频分享学习。Python是未来的发展方向,正在挑战我们的分析能力及对世界的认知方式,因而,我们与时俱进,迎接变化,并不断的成长,掌握Python核心技术,才是掌握真正的价值所在。
1. 使用示例
2. 详细详情
2.1 公告浏览器对象
即告诉程序,应该使用哪个浏览器进行操作
2.2 访问页面
2.3 查找元素
成功访问网页后,我们可能需要进行少量操作,比方找到搜索框而后输入关键字再敲击回车键。
因而,就需要在selenium中查找元素。
2.3.1 单个元素
selenium查找元素有两种方法。
第一种,是指定使用哪种方法去查找元素,比方指定依照CSS选择或者者依照xpath去进行查找
下面是详细的元素查找方法
find_element_by_name
find_element_by_xpath
find_element_by_link_text
find_element_by_partial_link_text
find_element_by_tag_name
find_element_by_class_name
find_element_by_css_selector
第二种,是直接使用find_element(),传入的第一个参数为需要使用的元素查找方法
2.3.2 多个元素
查找多个元素和查找单个元素的方法基本一致(只要要将查找单个元素的func里加一个s)。
查找多个元素返回的是一个list。
2.4 元素交互操作
元素交互是先获取一个元素,而后对获取的元素调用交互方法。
比方说在搜索框内输入文字:
2.5 交互动作
交互动作是将动作附加到交互链中串行执行,需要使用到ActionChains。
2.6 执行JavaScript
比方拖拽下拉
2.7 获取元素信息
已经通过元素查找获取到元素后,可能还需要获取这个元素的属性、文本
2.7.1 获取属性
2.8 Frame
假如定位到父frame,是无法查找到子frame的信息的,因而需要切换到子frame再进行查找。同理,在子frame也无法查找到父frame的信息
2.9 等待
请求网页时,可能会存在AJAX异步加载的情况。而selenium只会加载主网页,并不会考虑到AJAX的情况。因而,使用时需要等待少量时间,让网页加载完全后再进行操作。
2.9.1 隐式等待
使用隐式等待时,假如webdriver没有找到指定的元素,将继续等待。超出规定时间后,假如还是没又找到指定元素则抛出找不到元素的异常。默认等待时间为0。
隐式等待是对整个页面进行等待。
需要特别说明的是:隐性等待对整个driver的周期都起作用,所以只需设置一次就可。
2.9.2 显式等待
显示等待包含了等待条件和等待时间。
首先判定等待条件能否成立,假如成立,则直接返回;假如条件不成立,则等待最长时间为等待时间,假如超过等待时间后依然没有满足等待等待条件,则抛出异常。
显式等待是对指定的元素进行等待。
2.10 浏览器的前进/后退
back实现回到前一页面,forward实现前往下一页面
2.11 对Cookies进行操作
2.12 选项卡管理
选项卡管理就是浏览器的标签。有些时候我们需要在浏览器里添加一个新标签页或者者删除一个标签页,即可以使用selenium来实现。
1. 本站所有资源来源于用户上传和网络,如有侵权请邮件联系站长!
2. 分享目的仅供大家学习和交流,您必须在下载后24小时内删除!
3. 不得使用于非法商业用途,不得违反国家法律。否则后果自负!
4. 本站提供的源码、模板、插件等等其他资源,都不包含技术服务请大家谅解!
5. 如有链接无法下载、失效或广告,请联系管理员处理!
6. 本站资源售价只是摆设,本站源码仅提供给会员学习使用!
7. 如遇到加密压缩包,请使用360解压,如遇到无法解压的请联系管理员
开心源码网 » python爬虫Selenium库详细教程