Selenium总结:模拟浏览器动态加载页面
2016-11-27 20:13
459 查看
相信爬取大公司的数据时,常常会遇到页面信息动态加载的问题,
如果仅仅使用content = urllib2.urlopen(URL).read(),估计信息是获取不全的,这时候就需要模拟浏览器加载页面的过程,
selenium提供了方便的方法,我也是菜鸟,试了很多种方式,下面提供觉得最靠谱的(已经证明对于爬取新浪微博的topic、twitter under topic完全没问题)。
至于下面的browser变量是什么,看前面的几篇文章。
首先是请求对应的URL:
right_URL = URL.split("from")[0] + "current_page="+str(current_page) + "&since_id="+str(since_id) + "&page="+str(page_index) + "#Pl_Third_App__"+str(Pl_Third_App)
print right_URL
try:
browser.get(right_URL)
print "loading more, sleep 3 seconds ... 0"
time.sleep(3) # NO need for this sleep, but we add ...
browser = selenuim_loading_more(browser, method_index=0)
except:
print "one exception happen ==> get_tweeter_under_topic 2 ..."
pass
然后模拟浏览器,加载更多(推荐使用method_index=0,已经证明比其他好用很多):
def selenuim_loading_more(browser, method_index=0):
if method_index==0:
browser.implicitly_wait(3) # 为了快速滑动,先设置超时时间为1秒
# while True:
for i in range(1, 4): # at most 3 times
print "loading more, window.scrollTo bettom for the", i,"time ..."
browser.execute_script("window.scrollTo(0,document.body.scrollHeight);")
try:
# 定位页面底部的换页tab
browser.find_element_by_css_selector("div[class='W_pages']")
break # 如果没抛出异常就说明找到了底部标志,跳出循环
except NoSuchElementException:
pass # 抛出异常说明没找到底部标志,继续向下滑动
browser.implicitly_wait(4) # 将超时时间改回10秒
elif method_index==1:
browser.find_element_by_css_selector("div[class='empty_con clearfix']").click() # loading more
print "loading more, sleep 4 seconds ... 1"
time.sleep(4)
browser.find_element_by_css_selector("div[class='empty_con clearfix']").click() # loading more
print "loading more, sleep 3 seconds ... 2"
time.sleep(2)
elif method_index==2:
load_more_1 = browser.find_element_by_css_selector("div[class='empty_con clearfix']") # loading more
ActionChains(browser).click(load_more_1).perform()
print "loading more, sleep 4 seconds ... 1"
time.sleep(4)
load_more_2 = browser.find_element_by_css_selector("div[class='empty_con clearfix']") # loading more
ActionChains(browser).click(load_more_2).perform()
print "loading more, sleep 3 seconds ... 2"
time.sleep(2)
elif method_index==3:
print "loading more, sleep 4 seconds ... 1"
element = WebDriverWait(browser, 4).until(
EC.element_to_be_clickable((By.CSS_SELECTOR, "div[class='empty_con clearfix']"))
)
element.click()
print "loading more, sleep 2 seconds ... 2"
WebDriverWait(browser, 2).until(
EC.element_to_be_clickable((By.CSS_SELECTOR, "div[class='empty_con clearfix']"))
).click()
return browser
希望可以帮到一些人。。。
如果仅仅使用content = urllib2.urlopen(URL).read(),估计信息是获取不全的,这时候就需要模拟浏览器加载页面的过程,
selenium提供了方便的方法,我也是菜鸟,试了很多种方式,下面提供觉得最靠谱的(已经证明对于爬取新浪微博的topic、twitter under topic完全没问题)。
至于下面的browser变量是什么,看前面的几篇文章。
首先是请求对应的URL:
right_URL = URL.split("from")[0] + "current_page="+str(current_page) + "&since_id="+str(since_id) + "&page="+str(page_index) + "#Pl_Third_App__"+str(Pl_Third_App)
print right_URL
try:
browser.get(right_URL)
print "loading more, sleep 3 seconds ... 0"
time.sleep(3) # NO need for this sleep, but we add ...
browser = selenuim_loading_more(browser, method_index=0)
except:
print "one exception happen ==> get_tweeter_under_topic 2 ..."
pass
然后模拟浏览器,加载更多(推荐使用method_index=0,已经证明比其他好用很多):
def selenuim_loading_more(browser, method_index=0):
if method_index==0:
browser.implicitly_wait(3) # 为了快速滑动,先设置超时时间为1秒
# while True:
for i in range(1, 4): # at most 3 times
print "loading more, window.scrollTo bettom for the", i,"time ..."
browser.execute_script("window.scrollTo(0,document.body.scrollHeight);")
try:
# 定位页面底部的换页tab
browser.find_element_by_css_selector("div[class='W_pages']")
break # 如果没抛出异常就说明找到了底部标志,跳出循环
except NoSuchElementException:
pass # 抛出异常说明没找到底部标志,继续向下滑动
browser.implicitly_wait(4) # 将超时时间改回10秒
elif method_index==1:
browser.find_element_by_css_selector("div[class='empty_con clearfix']").click() # loading more
print "loading more, sleep 4 seconds ... 1"
time.sleep(4)
browser.find_element_by_css_selector("div[class='empty_con clearfix']").click() # loading more
print "loading more, sleep 3 seconds ... 2"
time.sleep(2)
elif method_index==2:
load_more_1 = browser.find_element_by_css_selector("div[class='empty_con clearfix']") # loading more
ActionChains(browser).click(load_more_1).perform()
print "loading more, sleep 4 seconds ... 1"
time.sleep(4)
load_more_2 = browser.find_element_by_css_selector("div[class='empty_con clearfix']") # loading more
ActionChains(browser).click(load_more_2).perform()
print "loading more, sleep 3 seconds ... 2"
time.sleep(2)
elif method_index==3:
print "loading more, sleep 4 seconds ... 1"
element = WebDriverWait(browser, 4).until(
EC.element_to_be_clickable((By.CSS_SELECTOR, "div[class='empty_con clearfix']"))
)
element.click()
print "loading more, sleep 2 seconds ... 2"
WebDriverWait(browser, 2).until(
EC.element_to_be_clickable((By.CSS_SELECTOR, "div[class='empty_con clearfix']"))
).click()
return browser
希望可以帮到一些人。。。
相关文章推荐
- Selenium 模拟浏览器动态加载页面的实现方法
- 根据浏览器语言,页面动态加载对应的js文件
- JQuery监听页面滚动总结和浏览器动态显示加载图片
- Python利用selenium模拟浏览器抓取异步加载等难爬页面信息
- 爬天眼查,动态加载的网页,模拟浏览器方法
- 多浏览器兼容的动态加载 JavaScript 与 CSS第1/2页
- 如何在页面中动态加载Web用户控件
- 通过使页面动态加载不同CSS实现多界面
- 如何实现从服务器端向页面动态加载JavaScript脚本?
- ASP.NET使用动态加载控件,注意页面生命周期
- 动态加载控件UserControl到页面上 . 视图状态问题
- 动态加载控件UserControl到页面上:视图状态问题
- 如何在页面动态加载UserControl?
- ComponentArt 动态加载的TreeView, 添加一个新节点后,新节点为什么在页面中不会显示?
- 使用PlaceHolder动态加载用户控件,为何aspx页面再次提交后用户控件消失?
- 向页面动态加载JS文件的的一个小技巧
- asp.net 中使用iframe动态加载页面
- 偶然发现网站换肤一招:使页面动态加载不同CSS实现多界面
- SolpartMenu的使用:(二)、在ASP.NET页面中使用SolpartMenu控件之动态的加载数据库中的数据来生成菜单
- 在页面加载时,模拟键盘输入