爬虫、知识图谱和开源情报分析01

再开一个新坑,这个也是我学习和工作中一直非常感兴趣而且投入较多时间研究的一个领域。主要是想通过这个系列完成以下目标
1.梳理爬虫的实践方法
2.梳理知识图谱的实践方法
3.梳理知识图谱中NLP的运用
4.实现雷达和EW领域的实用化的知识图谱

方法还是书籍+论文+代码
主要参考书包括:
《python3网络爬虫开发实战》 崔庆才
《知识图谱:方法、实践与应用》王昊奋老师的
在这里插入图片描述

情报是对已有信息进行分析、加工之后,得到有用信息的过程,情报的获取历来在人类活动中占用重要地位。信息技术的高速发展给情报工作带来了新的机遇和挑战,从根本上改变了情报的获取途径和研究方法,开源情报已经成为了各组织获取情报的主要方式。
随着互联网的迅速普及发展,它已经逐渐融入人们日常生活的方方面面。其中是人们在互联网上互相沟通、获取外界信息的重要途径。作为一个很有价值的信息来源,凭借其直观便利的使用方式以及丰富的内容表达能力,可以为用户提供多种形式的信息,例如文本、音频、视频等。随着时间的推移,互联网的信息规模及其用户群体规模也在快速增长。互联网用户的需求正在变得越发多样化,如何为用户快速地提供其所感兴趣的信息是目前的一大难题。
当前互联网上的信息内容大多都是页面。页面一般釆用描述,其中包含文字、图像、视频、音频等非结构化的数据。直接导致现有适于处理结构化数据的应用程序难以直接使用页面上包含的数据。很自然的,可以采用人工的方式实现数据的采集,并按事先规定好的格式,整理转换从网上采集的各种信息。在早期互联网规模较小的时代,这种人工采集方式确实比较可取。但是随着互联网规模不断地膨胀,人工釆集信息的方式已经难以适应海量的信息规模。因此有必要通过采用某种技术或其他手段完成从互联网上自动进行信息采集。
目前网络爬虫是公认的完成网络信息自动采集任务最为有效的工具。网络爬虫的本质是一种可以分析和追踪网络超链接结构,并按照特定的策略持续进行资源发掘和收集的功能模块。网络爬虫技术是随着搜索引擎发展而伴随产生并普及的一种通用的信息采集技术。其最为成功且广泛的应用就是作为搜索引擎网络信息的前沿,负责完成网页信息的采集任务,为搜索引擎提供检索信息的数据来源。所以可以说网络爬虫是搜索引擎信息提供者,其信息釆集的性能和策略将直接影响到搜索引擎提供的网页质量以及信息更新的时效性。因而围绕网络爬虫相关的信息采集技术研究具有重要的应用意义。
目前信息采集系统在国内外都已经出现的较多了,包括各类幵源的或者商用的爬虫,它们一般都是广义上的信息采集系统,其突出特点是均面向整个范围来进行研究,可分为如下几类:
(1)基于整个Web的信息采集
(2)面向主题的Web信息采集。简要来说即按照事先设定的主题,有针对性地采集与主题相关的页面信息。主题的描述一般用关键词,也可以采用样本文件。
(3)增量式Web信息采集。(这个也是我想做的)其特点是,在首次信息采集完成之后,若经过一段时间后,某些采集的信息发生变化或过时,这是后续开始的信息采集工作会有针对性地仅采集那些发生变动的页面,其他没有变化的网页则不予采集。这样的特性使得该采集方式具有很高的采集效率。
(4)个性化的Web信息釆集。主要通过与用户交互等手段,以用户的兴趣为导向,尽可能地满足用户多元化的信息需求。用户的个性化信息本身的获取可以通过两种方式:用户利用系统提供的接口主动设置或者系统跟踪用户的使用行为习惯自行学习分析。
(5)分布式Web信息采集

在这里插入图片描述

1 开发环境配置

1.1 python和pycharm编译器

关于python,在windows环境下安装的朋友们,推荐大家通过anaconda环境安装。

1.2 相关的请求库

在实现自己的爬虫的过程中,需要用到以下的请求库
首先是要在爬取web信息的过程中,需要模拟浏览器向服务器发送请求,涉及的库包括
requests 安装方法 在cmd中输入pip install requests即可自动安装
检验是否安装成功的办法是,在IDE中输入import requests
其次是Selenium,它是一个自动化的测试工具,利用它可以驱动浏览器执行特定的动作,比如在网页上的各种点击、退出、下拉等动作。安装和测试方法同上。
另外,爬取网页后,需要从网页中提取信息,这就需要调用一些现成的解析库,包括lxml、Beautiful soup、pyquery
然后再就是数据库的安装,这里推荐MongoDB和Redis
然后如果想通过python和这些数据库交互的话,还需要安装相应的存储库,包括PyMongo等

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐