2024年Python爬虫入门教程24:下载某网站付费文档保存PDF(1)
本文的文字及图片来源于网络,仅供学习、交流使用,不具有任何商业用途,如有问题请及时联系我们以作处理。
Python爬虫入门教程23:A站视频的爬取,解密m3u8视频格式
PS:如有需要 Python学习资料 以及 解答 的小伙伴可以加点击下方链接自行获取
-
Python 3.6
-
Pycharm
import requests
import parsel
import re
import os
import pdfkit
安装Python并添加到环境变量,pip安装需要的相关模块即可。
需要使用到一个软件 wkhtmltopdf 这个软件的作用就是把html文件转成PDF
(软件可以点击上方链接在学习交流群中即可获取)
想要把文档内容保存成PDF, 首先保存成html文件, 然后把html文件转PDF
写爬虫程序,对于数据来源的分析,是比较重要的,因为只有当你知道数据的来源你才能通过代码去实现

网站分类有比较多种, 也可以选择自己要爬取的。
这个网站如果你只是正常直接去复制文章内容的话,会直接弹出需要费的窗口…

但是这个网站上面的数据内容又非常好找, 因为网站本身仅仅只是静态网页数据,可以直接获取相关的内容。

通过上述内容,如果想要批量下载文章内容, 获取每篇文章的url地址即可, 想要获取每篇文章的url地址,这就需要去文章的列表页面找寻相关的数据内容了。

-
发送请求,对于文章列表url地址发送请求
-
获取数据,获取网页源代码数据内容
-
解析数据,提取文章url地址
-
发送请求,对于文章url地址发送请求
-
获取数据,获取网页源代码数据内容
-
解析数据,提取文章标题以及文章内容
-
保存数据,把获取的数据内容保存成PDF
-
转成PDF文件
网上学习资料一大堆,但如果学到的知识不成体系,遇到问题时只是浅尝辄止,不再深入研究,那么很难做到真正的技术提升。
一个人可以走的很快,但一群人才能走的更远!不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人,都欢迎加入我们的的圈子(技术交流、学习资源、职场吐槽、大厂内推、面试辅导),让我们一起学习成长!
更多推荐
所有评论(0)