爬虫学习,不涉及任何商业利益,如有侵权,联系立删。
        放上图片网站url:4K美女壁纸_高清4K美女图片大全_彼岸图网

        放一张美照作为封面

    本质上就两个部分,一个找到对应网址,一个进行爬取下载。分别对应下面两个函数craw_html和parse_and_download。然后urls利用规律。

        

import requests
import os
from bs4 import BeautifulSoup


url1 = "https://pic.netbian.com/4kmeinv/"


def craw_html(url):
    resp = requests.get(url)
    resp.encoding = "gbk"
    """
    print(resp.status_code)
    """
    html = resp.text
    return html


def parse_and_download(html):

    soup = BeautifulSoup(html, "html.parser")
    imgs = soup.find_all("img")

    output_folder = "C://Users//86152//Desktop//图片"  # 修改为你的输出文件夹路径

    for img in imgs:
        img_url = img.get("src")
        if "/uploads" not in img_url:
            continue
        src = f"http://pic.netbian.com{img_url}"
        """print(src)"""

        filename = os.path.basename(src)
        output_path = os.path.join(output_folder, filename)

        resp_img = requests.get(src, verify=False)
        with open(output_path, "wb") as f:
            f.write(resp_img.content)

urls = [
    f"https://pic.netbian.com/4kmeinv/index_{i}.html"
    for i in range(2, 5)#不包括5
]

html1=craw_html(url1)
parse_and_download(html1)

for url in urls:
    html = craw_html(url)
    parse_and_download(html)

        解释一下,由于网站url的规律从第二页才开始,也就是说第一页并没有i这个规律特性在,所有就单独爬取了第一页,要调整爬取页数在range(2,5)内改就行,url1是第一页的内容。urls利用规律对后面的的网址进行依次爬取。
        

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐