python爬取多页数据_python爬虫实现爬取同一个网站的多页数据代码实例
本篇文章小編給大家分享一下python爬蟲實現爬取同一個網站的多頁數據代碼實例,文章代碼介紹的很詳細,小編覺得挺不錯的,現在分享給大家供大家參考,有需要的小伙伴們可以來看看。
一、爬蟲的目的
從網上獲取對你有需要的數據
二、爬蟲過程
1、獲取url(網址)。
2、發出請求,獲得響應。
3、提取數據。
4、保存數據。
三、爬蟲功能
可以快速批量的獲取想要的數據,不用手動的一個個下載(圖片、文字音視頻等)
四、使用python爬蟲爬取同一網站多頁數據
1、需要定位至該標簽并獲得總頁數
def get_page_size(soup):
pcxt=soup.find('div',{'class':'babynames-term-articles'}).find('nav')
pcxt1=pcxt.find('div',{'class':'nav-links'}).findAll('a')
for i in pcxt1[:-1]:
link=i.get('href')
s=str(i)
page=re.sub('','',page1)
page3=re.sub('','',page2)
pagesize=int(page3)
print(pagesize)
return pagesize
Pass
2、更改url來訪問網址,也就是進行主函數的編寫
if __name__ == '__main__':
url="http://www.sheknows.com/baby-names/browse/a/"
soup=get_requests(url)
page=get_page_size(soup)
for i in range(1,page+1):
url1=url+"page/"+str(i)+"/"
soup1=get_requests(url1)
draw_base_list(soup1)
實例擴展:
import requests
from lxml import etree
import re
url="https://movie.douban.com/top250"
header = {"User-Agent":"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/79.0.3945.130 Safari/537.36"}
allMovieList=[]
flag = True
while flag:
html = requests.get(url, headers=header).text
list = etree.HTML(html)
lis = list.xpath('//ol[@class="grid_view"]/li')
for oneSelector in lis:
name = oneSelector.xpath("div/div[2]/div[1]/a/span[1]/text()")[0]
score = oneSelector.xpath("div/div[2]/div[2]/div/span[2]/text()")[0]
people = oneSelector.xpath("div/div[2]/div[2]/div/span[4]/text()")[0]
people = re.findall("(.*?)人評價",people)[0]
oneMovieList = [name,score,people]
allMovieList.append(oneMovieList)
#獲取下一頁地址
try:
next_url = list.xpath('//span[@class="next"]/a/@href')[0]
if next_url:
url = "https://movie.douban.com/top250"+ next_url
except:
flag = False
print(allMovieList)
總結
以上是生活随笔為你收集整理的python爬取多页数据_python爬虫实现爬取同一个网站的多页数据代码实例的全部內容,希望文章能夠幫你解決所遇到的問題。
- 上一篇: emqx配置mysql认证,emqx使用
- 下一篇: python整数转字节数组_【转】Pyt