数据:数据元:数据集:数据清洗:标准:节点:迁移:数据迁移:挂载:增量:DMP:关联:资源:物化:名词解释

数据:
数据(data)是事实或观察的结果,是对客观事物的逻辑归纳,是用于表示客观事物的未经加工的的原始素材。
数据是信息的表现形式和载体,可以是符号、文字、数字、语音、图像、视频等。数据和信息是不可分离的,数据是信息的表达,信息是数据的内涵。数据本身没有意义,数据只有对实体行为产生影响时才成为信息。
数据可以是连续的值,比如声音、图像,称为模拟数据。也可以是离散的,如符号、文字,称为数字数据。
在计算机系统中,数据以二进制信息单元0.1的形式表示。

数据元:
数据元(Data element):又称数据类型,通过定义、标识、表示以及允许值等一系 列属性描述的数据单元。在特定的语义环境中被认为是不可再分的最小数据单元。
data element(数据元素),单个数据单元,是数据的基本单位。参阅data field(数据字段)。
data item(数据项),组成数据元素的最小单位,是数据中不可再分的最小单元。
data field(数据字段),数据记录中已有定义的部分,例如数据库表中的一列。
综上,data element(数据元素),泛指结构化数据中的最小组成单位。
原则和依据
折叠船舶基础数据元研究范围、选取原则和依据
船舶基础数据元集重点涵盖交通部海事局、直属海事局、交通部救捞局等水上安全管理部门日常船舶管理工作中的报表、统计表等涉及的主要技术指标和数据项。船舶基础数据元集的各指标和数据项主要以水上安全监督信息系统、船舶安全统计检查、船舶证书发放统计、搜救情况统计等统计报表的指标设置为依据,进行组织、分类和筛选。数据元的选取主要以该指标项在水上安全船舶管理工作中的重要性为原则,以水上安全业务中船舶管理工作的分工和范围为参考,划分数据组织方式,并参考借鉴了国家标准和交通行业标准的内容进行组织、分类,收集整理而成。适用于交通行业建立的船舶数据库的基础数据、与船舶密切相关的主要技术指标的采集和有关信息系统所涉及的船舶数据的采集。
折叠航道基础数据元研究范围、选取原则和依据
折叠港口基础数据元研究范围、选取原则和依据
港口基础数据元集重点涵盖了反映港口基本运力主要指标的数据项,同时涵盖了交通部部分统计系统中的港口数据指标的数据项。港口基础数据元集的各指标和数据项主要以港口普查方案中的指标设置为依据,进行组织、分类和筛选。同时综合考虑了行业管理中有关港口管理工作的指标设置,并参考借鉴了国家标准和交通行业标准的内容,收集整理而成。适用于交通行业建立的港口数据库的港口基本运力、港口统计等指标的采集和有关信息系统所涉及的港口数据的采集。
折叠公路基础数据元研究范围、选取原则和依据
公路基础数据元集重点涵盖交通行业建立的公路数据库的技术属性数据和有关信息系统所涉及的公路数据。公路基础数据元集将数据指标体系分为七大类:路线概况集、路基集、路面集、主要构造物集、沿线设施集、交通量集、沿线环境集等。其以国家标准、交通部颁发的公路信息化相关规范为依据,以公路管理业务现状及发展需求为基础,对公路技术属性数据指标集、指标项的组成与分类进行统一规划。适用于交通行业建立的公路数据库的技术属性数据的采集和有关信息系统所涉及的公路数据的采集。
折叠车辆基础数据元研究范围、选取原则和依据
机动车基础数据元集重点涵盖道路运输管理部门对运输业户、营运机动车管理工作涉及的主要技术指标和数据项。机动车基础数据元集的各项指标和数据项主要以营运机动车管理信息、营运机动车统计等指标的设置为依据,进行组织、分类和筛选。数据元的选取主要以该指标项在道路运输管理工作中的重要性为原则,以道路运输业务管理工作的分工和范围为参考,划分数据组织方式,并参照引用了有关国家标准和交通行业标准的内容进行组织、分类,收集整理而成。适用于交通行业建立的车辆数据库的营运机动车管理信息、营运机动车统计等指标的采集和有关信息系统所涉及的车辆数据的采集。

数据集:
数据集,又称为资料集、数据集合或资料集合,是一种由数据所组成的集合。
Data set(或dataset)是一个数据的集合,通常以表格形式出现。每一列代表一个特定变量。每一行都对应于某一成员的数据集的问题。它列出的价值观为每一个变量,如身高和体重的一个物体或价值的随机数。每个数值被称为数据资料。对应于行数,该数据集的数据可能包括一个或多个成员。
从历史上看,这个术语起源于大型机领域,在那里它有一个明确界定的意义,非常接近现代的计算机档案。这个主题是不包括在这里的。
最简单的情况下,只有一个变量,然后在数据集由一列列的数值组成,往往被描述为一个列表。尽管名称,这样一个单数据集不是一套通常的数学意义,因为某一个指定数值,可能会出现多次。通常的顺序并不重要,然后这样数值的集合可能被视为多重集,而不是(顺序)列表。
值可能是数字,例如真正的数字或整数,例如代表一个人的身高多少厘米,但也可能是象征性的数据(即不包括数字),例如代表一个人的种族问题。更一般的说,价值可以是任何类型描述为某种程度的测量。对于每一个变量,通常所有的值都是同类。但是也可能是"遗漏值",其中需要指出的某种方式。
数据集可以分成类型化数据集与非类型化数据集。
类型化数据集:这种数据集先从基DataSet 类派生,然后,使用XML 架构文件(.xsd 文件)中的信息生成新类。架构中的信息(表、列等)被作为一组第一类对象和属性生成并编译为此新数据集类。可以直接通过名称引用表和列,在VS.NET中可以智能感知元素的类型。
非类型化数据集:这种数据集没有相应的内置架构。与类型化数据集一样,非类型化数据集也包含表、列等,但它们只作为集合公开。需要通过Tables集合引用列。
分类:
分类,是指按照种类、等级或性质分别归类。语出《书·舜典》附亡《书》序:“帝厘下土,方设居方,别生分类,作《汩作》。”
基本解释
1.[Classify;Assort]按照种类、等级或性质分别归类。
2.把无规律的事物分为有规律的,按照不同的特点划分事物,使事物更有规律。
3.建立生物类别的分级系统的实践,其基础是推测生物间存在著一些自然关系。生物分类的科学一般称为分类学(Taxonomy)。

数据清洗:
数据清洗是指发现并纠正数据文件中可识别的错误的最后一道程序,包括检查数据一致性,处理无效值和缺失值等。与问卷审核不同,录入后的数据清理一般是由计算机而不是人工完成。
基本概念
数据清洗(Data cleaning)– 对数据进行重新审查和校验的过程,目的在于删除重复信息、纠正存在的错误,并提供数据一致性。[1]
数据清洗从名字上也看的出就是把"脏"的"洗掉",指发现并纠正数据文件中可识别的错误的最后一道程序,包括检查数据一致性,处理无效值和缺失值等。因为数据仓库中的数据是面向某一主题的数据的集合,这些数据从多个业务系统中抽取而来而且包含历史数据,这样就避免不了有的数据是错误数据、有的数据相互之间有冲突,这些错误的或有冲突的数据显然是我们不想要的,称为"脏数据"。我们要按照一定的规则把"脏数据"“洗掉”,这就是数据清洗。而数据清洗的任务是过滤那些不符合要求的数据,将过滤的结果交给业务主管部门,确认是否过滤掉还是由业务单位修正之后再进行抽取。不符合要求的数据主要是有不完整的数据、错误的数据、重复的数据三大类。数据清洗是与问卷审核不同,录入后的数据清理一般是由计算机而不是人工完成。
主要类型
折叠残缺数据
这一类数据主要是一些应该有的信息缺失,如供应商的名称、分公司的名称、客户的区域信息缺失、业务系统中主表与明细表不能匹配等。对于这一类数据过滤出来,按缺失的内容分别写入不同Excel文件向客户提交,要求在规定的时间内补全。补全后才写入数据仓库。
折叠错误数据
这一类错误产生的原因是业务系统不够健全,在接收输入后没有进行判断直接写入后台数据库造成的,比如数值数据输成全角数字字符、字符串数据后面有一个回车操作、日期格式不正确、日期越界等。这一类数据也要分类,对于类似于全角字符、数据前后有不可见字符的问题,只能通过写SQL语句的方式找出来,然后要求客户在业务系统修正之后抽取。日期格式不正确的或者是日期越界的这一类错误会导致ETL运行失败,这一类错误需要去业务系统数据库用SQL的方式挑出来,交给业务主管部门要求限期修正,修正之后再抽取。
折叠重复数据
对于这一类数据–特别是维表中会出现这种情况–将重复数据记录的所有字段导出来,让客户确认并整理。
数据清洗是一个反复的过程,不可能在几天内完成,只有不断的发现问题,解决问题。对于是否过滤,是否修正一般要求客户确认,对于过滤掉的数据,写入Excel文件或者将过滤数据写入数据表,在ETL开发的初期可以每天向业务单位发送过滤数据的邮件,促使他们尽快地修正错误,同时也可以做为将来验证数据的依据。数据清洗需要注意的是不要将有用的数据过滤掉,对于每个过滤规则认真进行验证,并要用户确认。

标准:
标准是规范性文件之一。其定义是为了在一定的范围内获得最佳秩序,经协商一致制定并由公认机构批准,共同使用的和重复使用的一种规范性文件。
基本定义
GB/T 20000.1-2014《标准化工作指南 第1部分: 标准化和相关活动的通用词汇》条目5.3中对标准描述为:通过标准化活动,按照规定的程序经协商一致制定,为各种活动或其结果提供规则、指南或特性,供共同使用和重复使用的一种文件。附录A表A.1序号2中对标准的定义是:为了在一定范围内获得最佳秩序,经协商一致制定并由公认机构批准,为各种活动或其结果提供规则、指南或特性,供共同使用和重复使用的一种文件。
国家标准GB/T 3935.1-83定义:“标准是对重复性事物和概念所做的统一规定,它以科学、技术和实践经验的综合为基础,经过有关方面协商一致,由主管机构批准,以特定的形式发布,作为共同遵守的准则和依据”。
国家标准GB/T 3935.1-1996 《标准化和有关领域的通用术语 第一部分:基本术语》中对标准的定义是:为在一定范围内获得最佳秩序,对活动或其结果规定共同的和重复使用的规则、导则或特性的文件。该文件经协商一致制定并经一个公认机构的批准。它以科学、技术和实践经验的综合成果为基础,以促进最佳社会效益为目的。
国际标准化组织(ISO)的国家标准化管理委员会(STACO)一直致力于标准化概念的研究,先后以"指南"的形式给"标准"的定义作出统一规定:
标准是由一个公认的机构制定和批准的文件。它对活动或活动的结果规定了规则、导则或特殊值,供共同和反复使用,以实现在预定领域内最佳秩序的效果。

资源:
"资源"是指一国或一定地区内拥有的物力、财力、人力等各种物质要素的总称。分为自然资源和社会资源两大类。前者如阳光、空气、水、土地、森林、草原、动物、矿藏等;后者包括人力资源、信息资源以及经过劳动创造的各种物质财富等。
在大数据里面我认为是单个数据,表,库,等。

物化:
物化,指的是中国战国时期哲学家庄子的一种泯除事物差别、彼我同化的精神境界。物化是中国古典文艺学、美学关于审美创造的独特范畴,它发端于老子哲学,成熟于庄子哲学。庄子的"心斋"奠定了物化的心理机制,审美移情是它的表现特征。

关联:
关联,指互相贯连。语出《尉缭子·将理》:“如此关联良民,皆囚之情也。”
基本解释

  1. [relevance;be connected with]∶互相贯连。
    国民经济各个部门都是关联着的。
  2. [conjunctive;conjunction]∶起连接作用的;相互有联系的。
    关联词语。[1]
    3.把两个或两个以上在意义上有密切联系的句子组合在一起,叫复句,也叫关联句。复句通常用一些关联词语来连接。关联词一般分转折关系、假设关系、条件关系等。关联词如:尽管……可是……、虽然……但是……、……却……、……然而……、…可是·…
    4.计算机编程术语,网络术语。
    5.歌曲名,演唱:好妹妹乐队。

DMP:数码播放技术
DMP技术用最通俗的话说就是显示器内置了一个解码芯片,用户在不开机的情况下,直接插上U盘等存储介质,通过显示器内置的DMP播放器可以直接播放视频、浏览相片。
AOC官方解释:DMP乐播技术(Digital Media Player)即数字媒体播放器。消费者就可以不用接PC,直接在显示器上插入存储卡如SD卡, MMC、 MS、记忆棒等,就可即插即用,直接浏览照片、进行音乐和视频等多媒体播放,就象一个数码相框一样。
AOC的"Rivio 魔戒"22宽屏2230Fm是全球第一款具有DMP乐播技术进行数字多媒体播放,具备数码相框功能的显示器。
DMP(Data-Management Platform)数据管理平台,是把分散的第一、第三方数据进行整合纳入统一的技术平台,并对这些数据进行标准化和细分,让用户可以把这些细分结果推向现有的互动营销环境里。在这一块做的比较好的,Chinapex创略的APEX DMP是一个独立、开放式、企业级数据管理平台,帮助广告主整合、细分、分析目标受众,并最终轻松地激活数据到他们的APEX LINK合作伙伴生态系统当中去。

增量:
增量是个名词,经济学上的增量是指在某一段时间内系统中保有数量的变化;数学上的增量是指数的变化值,即数值的变化方式和程度。
经济学名词
增量
在经济学中有三种类型不同的数量,即存量、流量与增量。存量是指系统在某一时点时的所保有的数量;流量是指在某一段时间内流入及(或)流出系统的数量(其中流入量或流出量称为单边流量,而流入量加流出量称为双边流量);增量则是指在某一段时间内系统中保有数量的变化。这三者之间的关系可用以下两个公式表示:
增量=流入量-流出量
本期期末存量=上期期末存量+本期内增量
数学名词
增量
从数学意义上讲,增量是指数的变化值,即数值的变化方式和程度。增量本身也是一个数。数的变化有增加和减少两种情况。当数增加时,增量为正;当数减少时,增量为负。增加或减少的越多,增量的绝对值就越大。如3增大到5,则3的增量为+2;3减少到1,则3的增量为-2。换句话说,增量就是变化后的数值与原数值的差。
既然数的变化有增加和减少,那么为什么数的变化值要叫作"增量",而不叫作"减量"呢?因为,在人类的思维之中,增加代表增多,有积极向上的意义;而减少多带有消极退步的感情色彩。故人们倾向于从增加和减少二者中,选择以"增加"为原型衍生出"增量"的概念。数据库中也常常出现增量概念。

挂载:
在windows操作系统中, 挂载通常是指给磁盘分区(包括被虚拟出来的磁盘分区)分配一个盘符。 第三方软件,如磁盘分区管理软件、虚拟磁盘软件等,通常也附带挂载功能。 在linux操作系统中, 挂载是指将一个设备(通常是存储设备)挂接到一个已存在的目录上。 我们要访问存储设备中的文件,必须将文件所在的分区挂载到一个已存在的目录上, 然后通过访问这个目录来访问存储设备。
挂载概念
在windows操作系统中,
挂载通常是指给磁盘分区(包括被虚拟出来的磁盘分区)分配一个盘符。
这个操作可以通过"计算机管理"中的"磁盘管理"来进行。
第三方软件,如磁盘分区管理软件、虚拟磁盘软件等,通常也附带挂载功能。
在linux操作系统中,
挂载是一个非常重要的功能,使用非常频繁。
它指将一个设备(通常是存储设备)挂接到一个已存在的目录上。
(这个目录可以不为空,但挂载后这个目录下以前的内容将不可用。)
需要理解的是,
linux操作系统将所有的设备都看作文件,
它将整个计算机的资源都整合成一个大的文件目录。
我们要访问存储设备中的文件,必须将文件所在的分区挂载到一个已存在的目录上,
然后通过访问这个目录来访问存储设备。

迁移:
迁移作为一个词语时,它的意思是离开原来的所在地而另换地点或由于自然力的作用从一地移向另一地。在心理学中,它指的是是一种学习对另一种学习的影响,指在一种情境中获得的技能、知识或态度对另一种情境中技能、知识的获得或态度的形成的影响。在遗传学中,也有不一样的意思。

数据迁移:
数据迁移(又称分级存储管理,hierarchical storage management,hsm)是一种将离线存储与在线存储融合的技术。它将高速、高容量的非在线存储设备作为磁盘设备的下一级设备,然后将磁盘中常用的 数据按指定的策略自动迁移到磁带库(简称带库)等二级大容量存储设备上。当需要使用这些数据时,分级存储系统会自动将这些数据从下一级存储设备调回到上一 级磁盘上。对于用户来说,上述数据迁移操作完全是透明的,只是在访问磁盘的速度上略有怠慢,而在逻辑磁盘的容量上明显感觉大大提高了。
数据迁移是将很少使用或不用的文件移到辅助存储系统(如磁带或光盘)的存档过程。这些文件通常是需在未来任何时间可进行方便访问的图像文档或历史信息。迁移工作与备份策略相结合,并且仍要求定期备份。还包括电脑数据迁移,迁移旧电脑(旧系统)中的数据、应用程序、个性化设置等到新电脑(新系统),在系统升级后很有必要。
数据迁移的实现可以分为3个阶段:数据迁移前的准备、数据迁移的实施和数据迁移后的校验。由于数据迁移的特点,大量的工作都需要在准备阶段完成,充分而周到的准备工作是完成数据迁移的主要基础。具体而言,要进行待迁移数据源的详细说明(包括数据的存储方式、数据量、数据的时间跨度);建立新旧系统数据库的数据字典;对旧系统的历史数据进行质量分析,新旧系统数据结构的差异分析;新旧系统代码数据的差异分析;建立新老系统数据库表的映射关系,对无法映射字段的处理方法;开发、部属ETL工具,编写数据转换的测试计划和校验程序;制定数据转换的应急措施。
其中,数据迁移的实施是实现数据迁移的3个阶段中最重要的环节。它要求制定数据转换的详细实施步骤流程;准备数据迁移环境;业务上的准备,结束未处理完的业务事项,或将其告一段落;对数据迁移涉及的技术都得到测试;最后实施数据迁移。
数据迁移后的校验是对迁移工作的检查,数据校验的结果是判断新系统能否正式启用的重要依据。可以通过质量检查工具或编写检查程序进行数据校验,通过试运行新系统的功能模块,特别是查询、报表功能,检查数据的准确性。

节点:
在电信网络中,一个节点(英语:node,拉丁语:nodus)是一个连接点,表示一个再分发点(redistribution point)或一个通信端点(一些终端设备)。节点的定义依赖于所提及的网络和协议层。一个物理网络节点是一个连接到网络的有源电子设备,能够通过通信通道发送、接收或转发信息。因此,无源分发点(如配线架或接插板)不是节点。
在网络理论或图论中,术语节点表示网络拓扑中,线相交或分支的点。
计算机网络节点
编辑
在数据通信中,一个物理网络节点可以是数据电路端接设备(DCE),如调制解调器、集线器、桥接器或交换机;也可以是一个数据终端设备(DTE),如数字手机,打印机或主机(例如路由器、工作站或服务器)。
如果所讨论的网络是一个LAN或WAN,每一个LAN或WAN节点(至少应该是数据链路层设备)必须拥有MAC地址,一般每个网卡拥有一个。例如计算机、包交换机、xDSL调制解调器(带有乙太接口)以及无线LAN接入点。注意,集线器构成一个物理网络节点,但是并不构成LAN网络节点。这是因为一个使用集线器连接的网络逻辑上来说是一个总线网络。类似的,中继器或PSTN调制解调器(带有串行接口)是一个物理网络节点而不是一个LAN节点。
如果所讨论的网络是Internet或一个Intranet,许多物理网络节点是主机(即通过IP地址来标识的Internet节点)。所有的主机都是物理网络节点。但是,一些数据链路层设备,如交换机、桥接器和WLAN接入点不拥有IP主机地址(除了有时用于管理目的),这些设备不认为是Internet节点或主机,但它们是物理网络节点和LAN节点。 [1]
电信网络节点
在固定电话网络中,一个节点可能是公开或私有的电话交换局、远程集线器或计算机,提供了一些智能网络服务。在蜂窝通信中,交换点和数据库,如基站控制器、归属位置寄存器、网关GPRS支持节点(GGSN)和GPRS服务支持节点(SGSN)都是节点的例子。蜂窝网络基站在此上下文中不被认为是节点。
在有线电视系统(CATV)中,这个术语有较广的语境,通常与光纤节点相关。这可以被定义为由一个公共光纤接收器提供服务的特定地理范围内的家庭或办公地点。一个光纤节点通常使用特定光纤节点所服务的"家园通过"数来描述。 [2]
网络拓扑
网络拓扑,指构成网络的成员间特定的排列方式。分为物理的,即真实的、或者逻辑的,即虚拟的两种。如果两个网络的连接结构相同,我们就说它们的网络拓扑相同,尽管它们各自内部的物理接线、节点间距离可能会有不同。

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐