您现在的位置：程式師世界 >> 編程語言 > >> 更多編程語言 >> Python

python爬蟲入門教程：爬取網頁圖片(親測可用)

編輯：Python

准備工作

語言：python

IDE：pycharm

首先是要用到的庫，因為是剛入門最簡單的程序，我們主要就用到下面這兩：

import requests //用於請求網頁
import re //正則表達式，用於解析篩選網頁中的信息

其中re是python自帶的，requests庫需要我們自己安裝，在命令行中輸入pip install requests即可。

然後隨便找一個網站，注意不要嘗試爬取隱私敏感信息，這裡找了個表情包網站：

注：此處表情包網站中的內容本來就可以免費下載，所以爬蟲只是簡化了我們一個個點的流程，注意不能去爬取付費資源。

我們要做的就是通過爬蟲把這些表情包下載到我們電腦裡。

編寫爬蟲程序
首先肯定要通過python訪問這個網站，代碼如下：

headers = {

'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:98.0) Gecko/20100101 Firefox/98.0'
}
response = requests.get('https://qq.yh31.com/zjbq/',headers=headers) //請求網頁

其中之所以要加headers這一段是因為有些網頁會識別到你是通過python請求的然後把你拒絕，所以我們要換個正常的請求頭。可以隨便找一個或者f12從網絡信息裡復制一個。

然後我們要找到我們要爬取的圖片在網頁代碼裡的位置，f12查看源代碼，找到表情包如下：

然後建立匹配規則，用正則表達式把中間那串替換掉，最簡單的就是.*?

t = '<img src="(.*?)" alt="(.*?)" width="160" height="120">'

像這樣。

然後就可以調用re庫裡的findall方法把相關內容爬下來了：

result = re.findall(t, response.text)

返回的內容是由字符串組成的列表，最後我們經由爬到的地址通過python語句把圖片下下來保存到文件夾裡就行了。

程序代碼

import requests import re import os image = '表情包' if not os.path.exists(image): os.mkdir(image) headers = {

'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:98.0) Gecko/20100101 Firefox/98.0'
}
response = requests.get('https://qq.yh31.com/zjbq/',headers=headers)
response.encoding = 'GBK'
response.encoding = 'utf-8'
print(response.request.headers)
print(response.status_code)
t = '<img src="(.*?)" alt="(.*?)" width="160" height="120">'
result = re.findall(t, response.text)
for img in result:
print(img)
res = requests.get(img[0], headers=headers )
print(res.status_code)
s = img[0].split('.')[-1] #截取圖片後綴，得到表情包格式，如jpg ，gif
with open(image + '/' + img[1] + '.' + s, mode='wb') as file:
file.write(res.content)