【爬虫】requests_html库学习笔记
·
requests_html库:基于requests库新增Ajax数据动态渲染.
基础操作与requests库大体一致.基础用法示例:
from requests_html import HTMLSession:导入库.
session=HTMLSession():创建session对象.
response=session.get(url):GET请求访问指定的url.
response.html.full_text:获取response的全文本.
渲染js环境配置:
from requests_html import HTMLSession:导入库
session=HTMLSession()
resp.html.render()
以上代码什么意思,我也不清楚,总之这么敲上去运行,第一次会自动进行环境配置,时间可能会长一些,因为服务器在国外.
主动渲染js,执行js,将网页上异步渲染的内容,结合至html再返回结果给response:
response.html.render()
获取一个随机User-Agent:user_agent=requests_html.user_agent()
以列表形式提取并返回响应源码中的所有url链接:response.html.links
返回绝对路径:response.html.absolute_links
更多推荐
所有评论(0)