Python爬虫美女图片
·
爬虫学习,不涉及任何商业利益,如有侵权,联系立删。
放上图片网站url:4K美女壁纸_高清4K美女图片大全_彼岸图网
放一张美照作为封面

本质上就两个部分,一个找到对应网址,一个进行爬取下载。分别对应下面两个函数craw_html和parse_and_download。然后urls利用规律。
import requests
import os
from bs4 import BeautifulSoup
url1 = "https://pic.netbian.com/4kmeinv/"
def craw_html(url):
resp = requests.get(url)
resp.encoding = "gbk"
"""
print(resp.status_code)
"""
html = resp.text
return html
def parse_and_download(html):
soup = BeautifulSoup(html, "html.parser")
imgs = soup.find_all("img")
output_folder = "C://Users//86152//Desktop//图片" # 修改为你的输出文件夹路径
for img in imgs:
img_url = img.get("src")
if "/uploads" not in img_url:
continue
src = f"http://pic.netbian.com{img_url}"
"""print(src)"""
filename = os.path.basename(src)
output_path = os.path.join(output_folder, filename)
resp_img = requests.get(src, verify=False)
with open(output_path, "wb") as f:
f.write(resp_img.content)
urls = [
f"https://pic.netbian.com/4kmeinv/index_{i}.html"
for i in range(2, 5)#不包括5
]
html1=craw_html(url1)
parse_and_download(html1)
for url in urls:
html = craw_html(url)
parse_and_download(html)
解释一下,由于网站url的规律从第二页才开始,也就是说第一页并没有i这个规律特性在,所有就单独爬取了第一页,要调整爬取页数在range(2,5)内改就行,url1是第一页的内容。urls利用规律对后面的的网址进行依次爬取。
更多推荐
所有评论(0)