一起进步吧!感谢大家的支持和关注

需求

批量下载简历模板
保存在 简历名.rar压缩包
目标地址:https://sc.chinaz.com/jianli/free.html


分析

  • 静态页面
  • get请求
  • 定位 xpath
  • 下载页面定位
  • 保存到本地

源代码

from lxml import etree
import requests

headers = {
    'User-Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/97.0.4692.71 Safari/537.36'
}
url = 'https://sc.chinaz.com/jianli/free.html'
response = requests.get(url=url, headers=headers)
response.encoding = 'utf-8'
page_text = response.text
# 数据解析:简历名称+详情页的url
tree = etree.HTML(page_text)
div_list = tree.xpath('//*[@id="container"]/div')
print(div_list)
for div in div_list:
    title = div.xpath('./p/a/text()')[0] + '.rar'

    detail_url = div.xpath('./p/a/@href')[0]

    # 详情页下载
    detail_page_text = requests.get(url=detail_url, headers=headers).text

    # 数据解析:下载地址
    tree = etree.HTML(detail_page_text)

    download_url = tree.xpath('//*[@id="down"]/div[2]/ul/li[1]/a/@href')[0]
    print(download_url)
    # 在下载请求建立模板
    data = requests.get(url=download_url, headers=headers).content
    with open(title, 'wb') as fp:
        fp.write(data)
    print(title, '保存下载成功!')



Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐