最新Python爬虫入门教程24:下载某网站付费文档保存PDF(2)
Python爬虫入门教程23:A站视频的爬取,解密m3u8视频格式
PS:如有需要 Python学习资料 以及 解答 的小伙伴可以加点击下方链接自行获取
-
Python 3.6
-
Pycharm
import requests
import parsel
import re
import os
import pdfkit
安装Python并添加到环境变量,pip安装需要的相关模块即可。
需要使用到一个软件 wkhtmltopdf 这个软件的作用就是把html文件转成PDF
(软件可以点击上方链接在学习交流群中即可获取)
想要把文档内容保存成PDF, 首先保存成html文件, 然后把html文件转PDF
写爬虫程序,对于数据来源的分析,是比较重要的,因为只有当你知道数据的来源你才能通过代码去实现

网站分类有比较多种, 也可以选择自己要爬取的。
这个网站如果你只是正常直接去复制文章内容的话,会直接弹出需要费的窗口…

但是这个网站上面的数据内容又非常好找, 因为网站本身仅仅只是静态网页数据,可以直接获取相关的内容。

通过上述内容,如果想要批量下载文章内容, 获取每篇文章的url地址即可, 想要获取每篇文章的url地址,这就需要去文章的列表页面找寻相关的数据内容了。

-
发送请求,对于文章列表url地址发送请求
-
获取数据,获取网页源代码数据内容
-
解析数据,提取文章url地址
-
发送请求,对于文章url地址发送请求
-
获取数据,获取网页源代码数据内容
-
解析数据,提取文章标题以及文章内容
-
保存数据,把获取的数据内容保存成PDF
-
转成PDF文件
import requests
import parsel
import re
import os
import pdfkit
html_filename = ‘html\’
if not os.path.exists(html_filename):
os.mkdir(html_filename)
pdf_filename = ‘pdf\’
if not os.path.exists(pdf_filename):
os.mkdir(pdf_filename)
html_str = “”"
<!doctype html>
{article}
“”"
def change_title(name):
pattern = re.compile(r"[/\😗?“<>|]”) # ‘/ \ : * ? " < > |’
new_title = re.sub(pattern, “_”, name) # 替换为下划线

感谢每一个认真阅读我文章的人,看着粉丝一路的上涨和关注,礼尚往来总是要有的:
① 2000多本Python电子书(主流和经典的书籍应该都有了)
② Python标准库资料(最全中文版)
③ 项目源码(四五十个有趣且经典的练手项目及源码)
④ Python基础入门、爬虫、web开发、大数据分析方面的视频(适合小白学习)
⑤ Python学习路线图(告别不入流的学习)
网上学习资料一大堆,但如果学到的知识不成体系,遇到问题时只是浅尝辄止,不再深入研究,那么很难做到真正的技术提升。
一个人可以走的很快,但一群人才能走的更远!不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人,都欢迎加入我们的的圈子(技术交流、学习资源、职场吐槽、大厂内推、面试辅导),让我们一起学习成长!
更多推荐
所有评论(0)