python爬虫之简历模板
·
一起进步吧!感谢大家的支持和关注
需求
批量下载简历模板
保存在 简历名.rar压缩包
目标地址:https://sc.chinaz.com/jianli/free.html
分析
- 静态页面
- get请求
- 定位 xpath
- 下载页面定位
- 保存到本地
源代码
from lxml import etree
import requests
headers = {
'User-Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/97.0.4692.71 Safari/537.36'
}
url = 'https://sc.chinaz.com/jianli/free.html'
response = requests.get(url=url, headers=headers)
response.encoding = 'utf-8'
page_text = response.text
# 数据解析:简历名称+详情页的url
tree = etree.HTML(page_text)
div_list = tree.xpath('//*[@id="container"]/div')
print(div_list)
for div in div_list:
title = div.xpath('./p/a/text()')[0] + '.rar'
detail_url = div.xpath('./p/a/@href')[0]
# 详情页下载
detail_page_text = requests.get(url=detail_url, headers=headers).text
# 数据解析:下载地址
tree = etree.HTML(detail_page_text)
download_url = tree.xpath('//*[@id="down"]/div[2]/ul/li[1]/a/@href')[0]
print(download_url)
# 在下载请求建立模板
data = requests.get(url=download_url, headers=headers).content
with open(title, 'wb') as fp:
fp.write(data)
print(title, '保存下载成功!')
更多推荐
所有评论(0)