爬虫的快速入门基础 (三)爬虫三大库知识以及requests库入门 第一章
一、爬虫三大库简单介绍 (后面会一个一个详细介绍使用方法)
import requests 这个就是导入 requests库
需要安装第三方库 就使用这个命令 pip install 第三方库的名称
比如 安装requests库 就是 pip install requests
需要打开cmd
比如:
from bs4 import BeautifulSoup 这个是导入 BeautifulSoup库的写法
爬虫三大库 Requests Lxml BeautifulSoup
二、requests库入门
第一个爬虫程序
# 这个是导入requests库
import requests
# 这个可以理解为 定义url网址链接是多少 这个链接需要你自己去复制你想要爬取的网址的链接
url ="http://www.baidu.com"
# 这个headers 在浏览器的f12工具中找 首先进入百度 按f12
# 然后如下图 找到网络
然后随便点一个名称 中的文件 往下滑 找到User-Agant 复制 整个User-Agant的内容 作为headers即可

headers={
'User-Agent':'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/888.66 (KHTML, like Gecko) Chrome/87.0.4222.29 Safari/888.66 Edg/22.0.3322.22'
}
req = requests.get(url=url,headers=headers)
#这个是进行解码
content = req.content.decode('utf-8')
# 为什么要加encoding='utf-8' 因为windows系统 默认的格式本来是gbk 需要encoding 编码为utf-8 然后下面的解码 要看获取的网站 是什么格式解码
# mode="w"覆盖写入 mode="r"只读 语法是 with open("文件路径","读写模式","编码方式") as 赋值对象:方法
# 下面的f 表示 被赋值的f
with open("mybaidu.html",mode="w",encoding='utf-8') as f:
f.write(content)
print("over")
# a.write()方法 a.read()方法 写入和读取数据
运行完成后 会看到文件中多一个这个:

他就是整个baidu的源代码 那么第一个爬虫程序就成功了!!!
更多推荐
所有评论(0)