林子雨主讲《大数据技术原理与应用》章节习题
1
单选(2分)
第三次信息化浪潮的标志是:
A.个人电脑的普及
B.互联网的普及
C.虚拟现实技术的普及
D.云计算、大数据、物联网技术的普及
正确答案:D你选对了提问
2
单选(2分)
就数据的量级而言,1PB数据是多少TB?
A.2048
B.1024
C.512
D.1000
正确答案:B你选对了提问
3
单选(2分)
以下关于云计算、大数据和物联网之间的关系,论述错误的是:
A.云计算侧重于数据分析
B.云计算、大数据和物联网三者紧密相关,相辅相成
C.物联网可以借助于大数据实现海量数据的分析
D.物联网可以借助于云计算实现海量数据的存储
正确答案:A你选对了提问
4
单选(2分)
以下哪个不是大数据时代新兴的技术:
A.MySQL
B.Spark
C.HBase
D.Hadoop
正确答案:A你选对了提问
5
单选(2分)
每种大数据产品都有特定的应用场景,以下哪个产品是用于批处理的:
A.Dremel
B.Storm
C.Pregel
D.MapReduce
正确答案:D你选对了提问
6
单选(2分)
每种大数据产品都有特定的应用场景,以下哪个产品是用于流计算的:
A.Hive
B.S4
C.Impala
D. GraphX
正确答案:B你选对了提问
7
单选(2分)
每种大数据产品都有特定的应用场景,以下哪个产品是用于图计算的:
A.Pregel
B.Flume
C.Storm
D.Cassandra
正确答案:A你选对了提问
8
单选(2分)
每种大数据产品都有特定的应用场景,以下哪个产品是用于查询分析计算的:
A.Dremel
B.HDFS
C.S4
D.MapReduce
正确答案:A你选对了提问
9
多选(3分)
数据产生方式大致经历了三个阶段,包括:
A.运营式系统阶段
B.感知式系统阶段
C.移动互联网数据阶段
D.用户原创内容阶段
正确答案:A、B、D你选对了提问
10
多选(3分)
大数据发展的三个阶段是:
A.大规模应用期
B.萌芽期
C.成熟期
D.低谷期
正确答案:A、B、C你选对了提问
11
多选(3分)
大数据的特性包括:
A.数据量大
B.数据类型繁多
C.处理速度快
D.价值密度低
正确答案:A、B、C、D你选对了提问
12
多选(3分)
图领奖获得者、著名数据库专家Jim Gray博士认为,人类自古以来在科学研究上先后经历了哪几种范式:
A.实验科学
B.数据密集型科学
C.理论科学
D.计算科学
正确答案:A、B、C、D你选对了提问
13
多选(3分)
大数据带来思维方式的三个转变是:
A.相关而非因果
B.精确而非全面
C.全样而非抽样
D.效率而非精确
正确答案:A、C、D你选对了提问
14
多选(3分)
大数据主要有哪几种计算模式:
A.查询分析计算
B.图计算
C.流计算
D.批处理计算
正确答案:A、B、C、D你选对了提问
15
多选(3分)
云计算的典型服务模式包括三种:
A. IaaS
B.PaaS
C.SaaS
D.MaaS
正确答案:A、B、C你选对了
1
单选(2分)
启动hadoop所有进程的命令是:
A.start-hdfs.sh
B.start-dfs.sh
C.start-all.sh
D.start-hadoop.sh
正确答案:C你选对了提问
2
单选(2分)
以下对Hadoop的说法错误的是:
A.Hadoop的核心是HDFS和MapReduce
B.Hadoop2.0增加了NameNode HA和Wire-compatibility两个重大特性
C.Hadoop MapReduce是针对谷歌MapReduce的开源实现,通常用于大规模数据集的并行计算
D.Hadoop是基于Java语言开发的,只支持Java语言编程
正确答案:D你选对了提问
3
单选(2分)
以下哪个不是Hadoop的特性:
A.高可靠性
B.支持多种编程语言
C.成本高
D.高容错性
正确答案:C你选对了提问
4
单选(2分)
以下名词解释不正确的是:
A.Hive:一个基于Hadoop的数据仓库工具,用于对Hadoop文件中的数据集进行数据整理、特殊查询和分析存储
B.HBase:提供高可靠性、高性能、分布式的行式数据库,是谷歌BigTable的开源实现
C.HDFS:分布式文件系统,是Hadoop项目的两大核心之一,是谷歌GFS的开源实现
D.Zookeeper:针对谷歌Chubby的一个开源实现,是高效可靠的协同工作系统
正确答案:B你错选为D提问
5
多选(3分)
以下哪些组件是Hadoop的生态系统的组件:
A.MapReduce
B.HBase
C.HDFS
D. Oracle
正确答案:A、B、C你选对了提问
6
多选(3分)
以下哪个命令可以用来操作HDFS文件:
A.hdfs dfs
B.hdfs fs
C.hadoop dfs
D.hadoop fs
正确答案:A、C、D你选对了
1
单选(2分)
HDFS的命名空间不包含:
A.目录
B.字节
C.文件
D.块
正确答案:B你选对了提问
2
单选(2分)
对HDFS通信协议的理解错误的是:
A.客户端与数据节点的交互是通过RPC(Remote Procedure Call)来实现的
B.名称节点和数据节点之间则使用数据节点协议进行交互
C.客户端通过一个可配置的端口向名称节点主动发起TCP连接,并使用客户端协议与名称节点进行交互
D.HDFS通信协议都是构建在IoT协议基础之上的
正确答案:D你选对了提问
3
单选(2分)
采用多副本冗余存储的优势不包含:
A.容易检查数据错误
B.节约存储空间
C.加快数据传输速度
D.保证数据可靠性
正确答案:B你选对了提问
4
单选(2分)
假设已经配置好环境变量,启动Hadoop和关闭Hadoop的命令分别是:
A.start-dfs.sh,stop-hdfs.sh
B.start-hdfs.sh,stop-hdfs.sh
C.start-dfs.sh,stop-dfs.sh
D.start-hdfs.sh,stop-dfs.sh
正确答案:C你选对了提问
5
单选(2分)
分布式文件系统HDFS采用了主从结构模型,由计算机集群中的多个节点构成的,这些节点分为两类,一类存储元数据叫 ,另一类存储具体数据叫 :
A.名称节点,主节点
B.数据节点,名称节点
C.名称节点,数据节点
D.从节点,主节点
正确答案:C你选对了提问
6
单选(2分)
下面关于分布式文件系统HDFS的描述正确的是:
A.分布式文件系统HDFS比较适合存储大量零碎的小文件
B.分布式文件系统HDFS是Google Bigtable的一种开源实现
C.分布式文件系统HDFS是谷歌分布式文件系统GFS(Google File System)的一种开源实现
D.分布式文件系统HDFS是一种关系型数据库
正确答案:C你选对了提问
7
多选(3分)
以下对名称节点理解正确的是:
A.名称节点作为中心服务器,负责管理文件系统的命名空间及客户端对文件的访问
B.名称节点用来负责具体用户数据的存储
C.名称节点通常用来保存元数据
D.名称节点的数据保存在内存中
正确答案:A、C、D你选对了提问
8
多选(3分)
以下对数据节点理解正确的是:
A.数据节点通常只有一个
B.数据节点在名称节点的统一调度下进行数据块的创建、删除和复制等操作
C.数据节点用来存储具体的文件内容
D.数据节点的数据保存在磁盘中
正确答案:B、C、D你选对了提问
9
多选(3分)
HDFS只设置唯一一个名称节点带来的局限性包括:
A.命名空间的限制
B.隔离问题
C.性能的瓶颈
D.集群的可用性
正确答案:A、B、C、D你选对了提问
10
多选(3分)
以下HDFS相关的shell命令不正确的是:
A.hadoop fs -ls <path>:显示<path>指定的文件的详细信息
B.hadoop fs -copyFromLocal <path1> <path2>:将路径<path2>指定的文件或文件夹复制到路径<path1>指定的文件夹中
C.hdfs dfs -rm <path>:删除路径<path>指定的文件
D.hadoop dfs mkdir <path>:创建<path>指定的文件夹
正确答案:B、D你选对了
1
单选(2分)
HBase是一种 数据库
A.行式数据库
B.文档数据库
C.列式数据库
D.关系数据库
正确答案:C你选对了提问
2
单选(2分)
下列对HBase数据模型的描述错误的是:
A.每个HBase表都由若干行组成,每个行由行键(row key)来标识
B.HBase列族支持动态扩展,可以很轻松地添加一个列族或列
C.HBase中执行更新操作时,会删除数据旧的版本,并生成一个新的版本
D.HBase是一个稀疏、多维度、排序的映射表,这张表的索引是行键、列族、列限定符和时间戳
正确答案:C你选对了提问
3
单选(2分)
下列说法正确的是:
A.如果不启动Hadoop,则HBase完全无法使用
B.HBase的实现包括的主要功能组件是库函数,一个Master主服务器和一个Region服务器
C.如果通过HBase Shell插入表数据,可以插入一行数据或一个单元格数据
D.Zookeeper是一个集群管理工具,常用于分布式计算,提供配置维护、域名服务、分布式同步等
正确答案:D你选对了提问
4
单选(2分)
在HBase数据库中,每个Region的建议最佳大小是:
A.100MB-200MB
B.500MB-1000MB
C.2GB-4GB
D.1GB-2GB
正确答案:D你选对了提问
5
单选(2分)
HBase三层结构的顺序是:
A.-ROOT-表,Zookeeper文件,.MEATA.表
B.Zookeeper文件,-ROOT-表,.MEATA.表
C..MEATA.表,Zookeeper文件,-ROOT-表
D.Zookeeper文件,.MEATA.表,-ROOT-表
正确答案:B你选对了提问
6
单选(2分)
客户端是通过 级寻址来定位Region:
A.二
B.三
C.一
D.四
正确答案:B你选对了提问
7
单选(2分)
关于HBase Shell命令解释错误的是:
A.list:显示表的所有数据
B. create:创建表
C.put:向表、行、列指定的单元格添加数据
D.get:通过表名、行、列、时间戳、时间范围和版本号来获得相应单元格的值
正确答案:A你选对了提问
8
多选(3分)
下列对HBase的理解正确的是:
A.HBase是一种关系型数据库,现成功应用于互联网服务领域
B.HBase是一个行式分布式数据库,是Hadoop生态系统中的一个组件
C. HBase是针对谷歌BigTable的开源实现
D.HBase多用于存储非结构化和半结构化的松散数据
正确答案:C、D你选对了提问
9
多选(3分)
HBase和传统关系型数据库的区别在于哪些方面:
A.数据索引
B.数据模型
C.存储模式
D. 数据操作
正确答案:A、B、C、D你选对了提问
10
多选(3分)
访问HBase表中的行,有哪些方式:
A.通过某列的值区间
B.全表扫描
C.通过一个行健的区间来访问
D.通过单个行健访问
正确答案:B、C、D你选对了
1
单选(2分)
下列关于NoSQL数据库和关系型数据库的比较,不正确的是:
A.NoSQL数据库很容易实现数据完整性,关系型数据库很难实现数据完整性
B.NoSQL数据库具有弱一致性,关系型数据库具有强一致性
C.NoSQL数据库缺乏统一的查询语言,而关系型数据库有标准化查询语言
D.NoSQL数据库的可扩展性比传统的关系型数据库更好
正确答案:A你选对了提问
2
单选(2分)
以下对各类数据库的理解错误的是:
A.图数据库灵活性高,支持复杂的图算法,可用于构建复杂的关系图谱
B.键值数据库的键是一个字符串对象,值可以是任意类型的数据,比如整型和字符型等
C.HBase数据库是列族数据库,可扩展性强,支持事务一致性
D.文档数据库的数据是松散的,XML和JSON 文档等都可以作为数据存储在文档数据库中
正确答案:C你选对了提问
3
单选(2分)
下列数据库属于文档数据库的是:
A.MongoDB
B.MySQL
C.HBase
D.Redis
正确答案:A你选对了提问
4
单选(2分)
NoSQL数据库的三大理论基石不包括:
A.CAP
B.ACID
C.BASE
D.最终一致性
正确答案:B你选对了提问
5
多选(3分)
关于NoSQL数据库和关系数据库,下列说法正确的是:
A.NoSQL数据库可以支持超大规模数据存储,具有强大的横向扩展能力
B.关系数据库有关系代数理论作为基础,NoSQL数据库没有统一的理论基础
C.NoSQL数据库和关系数据库各有优缺点,但随着NoSQL的发展,终将取代关系数据库
D.大多数NoSQL数据库很难实现数据完整性
正确答案:A、B、D你选对了提问
6
多选(3分)
NoSQL数据库的类型包括:
A.键值数据库
B.文档数据库
C.图数据库
D.列族数据库
正确答案:A、B、C、D你选对了提问
7
多选(3分)
CAP是指:
A.可用性
B.持久性
C.分区容忍性
D.一致性
正确答案:A、C、D你选对了提问
8
多选(3分)
NoSQL数据库的BASE特性是指:
A.最终一致性
B.软状态
C.持续性
D.基本可用
正确答案:A、B、D你选对了
1
单选(2分)
下列Amazon的云数据库属于关系数据库的是:
A.Amazon DynamoDB
B.Amazon SimpleDB
C.Amazon Redshift
D.Amazon RDS
正确答案:D你选对了提问
2
单选(2分)
下列关于UMP系统的说法不正确的是:
A.Controller服务器向UMP集群提供各种管理服务,实现集群成员管理、元数据存储等功能
B.Agent服务器部署在运行MySQL进程的机器上,用来管理每台物理机上的MySQL实例
C.Mnesia是UMP系统的一个组件,是一个分布式数据库管理系统,且不支持事务
D.UMP系统是低成本和高性能的MySQL云数据库方案
正确答案:C你错选为D提问
3
多选(3分)
UMP依赖的开源组件包括:
A.RabbitMQ
B.LVS
C.Mnesia
D.ZooKeeper
正确答案:A、B、C、D你选对了提问
4
多选(3分)
在UMP系统中,Zookeeper主要发挥的作用包括:
A.作为全局的配置服务器
B.提供分布式锁,选出一个集群的“总管”
C.监控所有MySQL实例
D.负责集群负载均衡
正确答案:A、B、C你选对了提问
5
多选(3分)
UMP系统设计了哪些机制来保证数据安全:
A.记录用户操作日志
B.数据访问IP白名单
C.SSL数据库连接
D.SQL拦截
正确答案:A、B、C、D你选对了
1
单选(2分)
下列说法错误的是:
A.不同的Map任务之间不能互相通信
B.MapReduce框架采用了Master/Slave架构,包括一个Master和若干个Slave
C.Hadoop框架是用Java实现的,MapReduce应用程序则一定要用Java来写
D.Map函数将输入的元素转换成<key,value>形式的键值对
正确答案:C你选对了提问
2
单选(2分)
在使用MapReduce程序WordCount进行词频统计时,对于文本行“hello hadoop hello world”,经过WordCount程序的Map函数处理后直接输出的中间结果,应该是下面哪种形式:
A.<"hello",<1,1>>、<"hadoop",1>和<"world",1>
B.<"hello",2>、<"hadoop",1>和<"world",1>
C.<"hello",1,1>、<"hadoop",1>和<"world",1>
D.<"hello",1>、<"hello",1>、<"hadoop",1>和<"world",1>
正确答案:D你选对了提问
3
单选(2分)
对于文本行“hello hadoop hello world”,经过WordCount的Reduce函数处理后的结果是:
A. <"hello",<1,1>><"hadoop",1><"world",1>
B.<"hello",1,1><"hadoop",1><"world",1>
C.<"hello",2><"hadoop",1><"world",1>
D.<"hello",1><"hello",1><"hadoop",1><"world",1>
正确答案:C你选对了提问
4
多选(3分)
下列关于传统并行计算框架(比如MPI)和MapReduce并行计算框架比较正确的是:
A.前者是共享式(共享内存/共享存储),容错性差,后者是非共享式的,容错性好
B.前者适用于实时、细粒度计算、计算密集型,后者适用于批处理、非实时、数据密集型
C.前者相比后者学习起来更难
D.前者所需硬件价格贵,可扩展性差,后者硬件便宜,扩展性好
正确答案:A、B、C、D你选对了提问
5
多选(3分)
MapReduce1.0的体系结构主要由哪几个部分组成:
A.Task
B.Client
C.JobTracker
D.TaskTracker
正确答案:A、B、C、D你选对了
1
单选(2分)
下列说法正确的是:
A.第二名称节点是热备份
B.HDFS HA可用性不好
C.HDFS HA提供高可用性,可以实现可扩展性、系统性能和隔离性
D.第二名称节点无法解决单点故障问题
正确答案:D你选对了提问
2
单选(2分)
HDFS Federation设计不能解决“单名称节点”存在的哪个问题:
A.性能更高效
B.良好的隔离性
C.HDFS集群扩展性
D.单点故障问题
正确答案:D你选对了提问
3
多选(3分)
下列哪些是Hadoop1.0存在的问题:
A.开发者自己管理作业之间的依赖关系
B.表达能力有限
C.执行迭代操作效率低
D.抽象层次低
正确答案:A、B、C、D你选对了提问
4
多选(3分)
下列对Hadoop各组件的理解正确的是:
A.Kafka:分布式发布订阅消息系统
B.Tez:支持DAG作业的计算框架
C.Pig:处理大规模数据的脚本语言
D.Oozie:工作流和协作服务引擎
正确答案:A、B、C、D你选对了提问
5
多选(3分)
对新一代资源管理调度框架YARN的理解正确的是:
A.YARN的体系结构包含三个组件:ResourceManager,NodeManager,ApplicationMaster
B.YARN既是资源管理调度框架,也是一个计算框架
C.YARN可以实现“一个集群多个框架”,即在一个集群上部署一个统一的资源调度管理框架
D.MapReduce2.0是运行在YARN之上的计算框架,由YARN来为MapReduce提供资源管理调度服务
正确答案:A、C、D你选对了
1
单选(2分)
下列有关Hive和Impala的对比错误的是:
A.Hive在内存不足以存储所有数据时,会使用外存,而Impala也是如此
B.Hive适合于长时间的批处理查询分析,而Impala适合于实时交互式SQL查询
C.Hive与Impala使用相同的元数据
D.Hive与Impala中对SQL的解释处理比较相似,都是通过词法分析生成执行计划
正确答案:A你选对了提问
2
单选(2分)
下列关于Hive基本操作命令的解释错误的是:
A.create table if not exists usr(id bigint,name string,age int);//如果usr表不存在,创建表usr,含三个属性id,name,age
B.load data local inpath ‘/usr/local/data’ overwrite into table usr; //把目录’/usr/local/data’下的数据文件中的数据以追加的方式装载进usr表
C.create database userdb;//创建数据库userdb
D.insert overwrite table student select * from user where age>10; //向表usr1中插入来自usr表的age大于10的数据并覆盖student表中原有数据
正确答案:B你选对了提问
3
多选(3分)
下列说法正确的是:
A.数据仓库Hive不需要借助于HDFS就可以完成数据的存储
B.HiveQL语法与传统的SQL语法很相似
C.Hive本身不存储和处理数据,依赖HDFS存储数据,依赖MapReduce处理数据
D.Impala和Hive、HDFS、HBase等工具可以统一部署在一个Hadoop平台上
正确答案:B、C、D你选对了提问
4
多选(3分)
Impala主要由哪几个部分组成:
A.Hive
B.CLI
C.State Store
D.Impalad
正确答案:B、C、D你选对了提问
5
多选(3分)
以下属于Hive的基本数据类型是:
A.TINYINT
B.STRING
C.FLOAT
D.BINARY
正确答案:A、B、C、D你选对了
1
单选(2分)
Spark SQL目前暂时不支持下列哪种语言:
A.Java
B.Scala
C.Python
D.Lisp
正确答案:D你选对了提问
2
单选(2分)
RDD操作分为转换(Transformation)和动作(Action)两种类型,下列属于动作(Action)类型的操作的是:
A.map
B.groupBy
C.count
D.filter
正确答案:C你选对了提问
3
单选(2分)
下列说法错误的是:
A.RDD提供的转换接口既适用filter等粗粒度的转换,也适合某一数据项的细粒度转换
B.Spark支持三种类型的部署方式:Standalone,Spark on Mesos,Spark on YARN
C.RDD采用惰性调用,遇到“转换(Transformation)”类型的操作时,只会记录RDD生成的轨迹,只有遇到“动作(Action)”类型的操作时才会触发真正的计算
D.在选择Spark Streaming和Storm时,对实时性要求高(比如要求毫秒级响应)的企业更倾向于选择流计算框架Storm
正确答案:A你选对了提问
4
单选(2分)
下列关于常见的动作(Action)和转换(Transformation)操作的API解释错误的是:
A.map(func):将每个元素传递到函数func中,并将结果返回为一个新的数据集
B.count():返回数据集中的元素个数
C.take(n):返回数据集中的第n个元素
D.filter(func):筛选出满足函数func的元素,并返回一个新的数据集
正确答案:C你选对了提问
5
单选(2分)
下列大数据处理类型与其对应的软件框架不匹配的是:
A.基于实时数据流的数据处理:Storm
B.复杂的批量数据处理:MapReduce
C.基于历史数据的交互式查询:Impala
D.图结构数据的计算:Hive
正确答案:D你选对了提问
6
多选(3分)
Apache软件基金会最重要的三大分布式计算系统开源项目包括:
A.Oracle
B.Storm
C.Spark
D.Hadoop
正确答案:B、C、D你错选为A、B、D提问
7
多选(3分)
Spark的主要特点包括:
A.运行速度快
B.运行模式多样
C.容易使用
D.通用性好
正确答案:A、B、C、D你选对了提问
8
多选(3分)
下列关于Scala的说法正确的是:
A.Scala是一种多范式编程语言
B.Scala具备强大的并发性,支持函数式编程
C.Scala运行于Java平台,兼容现有的Java程序
D.Scala是Spark的主要编程语言,但Spark还支持Java、Python、R作为编程语言
正确答案:A、B、C、D你选对了提问
9
多选(3分)
Spark的运行架构包括:
A.每个工作节点上负责具体任务的执行进程 Executor
B.每个应用的任务控制节点 Driver
C.集群资源管理器 Cluster Manager
D.运行作业任务的工作节点 Worker Node
正确答案:A、B、C、D你选对了
1
单选(2分)
流计算秉承一个基本理念,即数据的价值随着时间的流逝而 ,如用户点击流:
A.不确定
B.升高
C.降低
D.不变
正确答案:C你选对了提问
2
单选(2分)
Hadoop运行的是MapReduce任务,类似地,Storm运行的任务叫做
A.Bolt
B.Tuple
C.Topology
D.Spout
正确答案:C你选对了提问
3
多选(3分)
对于一个流计算系统来说,它应达到如下哪些需求:
A.高性能
B.分布式
C.海量式
D.实时性
正确答案:A、B、C、D你选对了提问
4
多选(3分)
数据采集系统的基本架构包括哪些部分:
A.Collector
B.Controller
C.Agent
D.Store
正确答案:A、C、D你选对了提问
5
多选(3分)
以下哪些是开源的流计算框架:
A.Twitter Storm
B.Yahoo! S4
C.IBM InfoSphere Streams
D.Facebook Puma
正确答案:A、B你选对了提问
6
多选(3分)
下面哪几个属于Storm中的Stream Groupings的分组方式:
A.按照字段分组
B.随机分组
C.广播发送
D.全局分组
正确答案:A、B、C、D你选对了
1
单选(2分)
以下哪个不是Flink的优势:
A.支持有状态计算
B.同时支持高吞吐、低延迟、高性能
C.不支持增量迭代
D.同时支持流处理和批处理
正确答案:C你选对了提问
2
单选(2分)
在Flink中哪个是基于批处理的图计算库:
A.SQL&Table库
B.FlinkML
C.CEP
D.Gelly
正确答案:D你选对了提问
3
多选(3分)
下面关于Flink的说法正确的是:
A.Flink可以同时支持实时计算和批量计算
B.Flink起源于Stratosphere 项目,该项目是在2010年到2014年间由柏林工业大学、柏林洪堡大学和哈索普拉特纳研究所联合开展的
C.Flink不是Apache软件基金会的项目
D.Flink是Apache软件基金会的5个最大的大数据项目之一
正确答案:A、B、D你选对了提问
4
多选(3分)
Flink的主要特性包括:
A.精密的状态管理
B.事件时间支持
C.精确一次的状态一致性保障
D.批流一体化
正确答案:A、B、C、D你选对了提问
5
多选(3分)
下面论述正确的是:
A.Storm虽然可以做到低延迟,但是无法实现高吞吐,也不能在故障发生时准确地处理计算状态
B.Spark Streaming通过采用微批处理方法实现了高吞吐和容错性,但是牺牲了低延迟和实时处理能力
C.流处理架构需要具备低延迟、高吞吐和高性能的特性,而目前从市场上已有的产品来看,只有Flink可以满足要求
D.Flink实现了Google Dataflow流计算模型,是一种兼具高吞吐、低延迟和高性能的实时流计算框架,并且同时支持批处理和流处理
正确答案:A、B、C、D你选对了提问
6
多选(3分)
Flink常见的应用场景包括:
A.数据流水线应用
B.数据分析应用
C.地图应用
D.事件驱动型应用
正确答案:A、B、D你选对了提问
7
多选(3分)
Flink核心组件栈分为哪三层:
A.Runtime核心层
B.Core层
C.物理部署层
D.API&Libraries层
正确答案:A、C、D你选对了提问
8
多选(3分)
Flink有哪几种部署模式:
A.Local模式
B.YARN集群模式
C.Standalone集群模式
D.运行在GCE(谷歌云服务)和EC2(亚马逊云服务)上
正确答案:A、B、C、D你选对了提问
9
多选(3分)
Flink系统主要由两个组件组成,分别为:
A.JobManager
B.TaskScheduler
C.JobScheduler
D.TaskManager
正确答案:A、D你选对了提问
10
多选(3分)
在编程模型方面,Flink 提供了不同级别的抽象,以开发流或批处理作业,主要包括哪几个级别的抽象:
A.状态化的数据流接口
B. SQL
C.Table API
D.DataStream API(有界或无界流数据)以及 DataSet API(有界数据集)
正确答案:A、B、C、D你选对了
1
单选(2分)
Pregel是一种基于 模型实现的并行图处理系统:
A.SBP
B.TSP
C.BSP
D.STP
正确答案:C你选对了提问
2
单选(2分)
谷歌在后Hadoop时代的新“三驾马车”不包括:
A.Caffeine
B.Pregel
C.Dremel
D.Hama
正确答案:D你选对了提问
3
多选(3分)
下列哪些是以图顶点为中心的,基于消息传递批处理的并行图计算框架:
A.Hama
B.Giraph
C.Pregel
D.Neo4j
正确答案:A、B、C你选对了提问
4
多选(3分)
以下关于Pregel图计算框架说法正确的是:
A.Pregel采用检查点机制来实现容错
B.通常只对满足交换律和结合律的操作才会开启Combiner功能
C.对于全局拓扑改变,Pregel采用了惰性协调机制
D.Aggregator提供了一种全局通信、监控和数据查看的机制
正确答案:A、B、C、D你选对了
1
单选(2分)
下列说法错误的是:
A.ItemCF算法推荐的是那些和目标用户之前喜欢的物品类似的其他物品
B.UserCF算法推荐的是那些和目标用户有共同兴趣爱好的其他用户所喜欢的物品
C.基于用户的协同过滤算法(简称UserCF算法)是目前业界应用最多的算法
D.UserCF算法的推荐更偏向社会化,而ItemCF算法的推荐更偏向于个性化
正确答案:C你选对了提问
2
多选(3分)
推荐方法包括哪些类型:
A.基于内容的推荐
B.专家推荐
C.基于统计的推荐
D.协同过滤推荐
正确答案:A、B、C、D你选对了
1
单选(2分)
第三次信息化浪潮的标志是:
A.个人电脑的普及
B.互联网的普及
C.虚拟现实技术的普及
D.云计算、大数据、物联网技术的普及
正确答案:D你选对了提问
2
单选(2分)
就数据的量级而言,1PB数据是多少TB?
A.2048
B.1024
C.512
D.1000
正确答案:B你选对了提问
3
单选(2分)
以下关于云计算、大数据和物联网之间的关系,论述错误的是:
A.云计算侧重于数据分析
B.云计算、大数据和物联网三者紧密相关,相辅相成
C.物联网可以借助于大数据实现海量数据的分析
D.物联网可以借助于云计算实现海量数据的存储
正确答案:A你选对了提问
4
单选(2分)
以下哪个不是大数据时代新兴的技术:
A.MySQL
B.Spark
C.HBase
D.Hadoop
正确答案:A你选对了提问
5
单选(2分)
每种大数据产品都有特定的应用场景,以下哪个产品是用于批处理的:
A.Dremel
B.Storm
C.Pregel
D.MapReduce
正确答案:D你选对了提问
6
单选(2分)
每种大数据产品都有特定的应用场景,以下哪个产品是用于流计算的:
A.Hive
B.S4
C.Impala
D. GraphX
正确答案:B你选对了提问
7
单选(2分)
每种大数据产品都有特定的应用场景,以下哪个产品是用于图计算的:
A.Pregel
B.Flume
C.Storm
D.Cassandra
正确答案:A你选对了提问
8
单选(2分)
每种大数据产品都有特定的应用场景,以下哪个产品是用于查询分析计算的:
A.Dremel
B.HDFS
C.S4
D.MapReduce
正确答案:A你选对了提问
9
多选(3分)
数据产生方式大致经历了三个阶段,包括:
A.运营式系统阶段
B.感知式系统阶段
C.移动互联网数据阶段
D.用户原创内容阶段
正确答案:A、B、D你选对了提问
10
多选(3分)
大数据发展的三个阶段是:
A.大规模应用期
B.萌芽期
C.成熟期
D.低谷期
正确答案:A、B、C你选对了提问
11
多选(3分)
大数据的特性包括:
A.数据量大
B.数据类型繁多
C.处理速度快
D.价值密度低
正确答案:A、B、C、D你选对了提问
12
多选(3分)
图领奖获得者、著名数据库专家Jim Gray博士认为,人类自古以来在科学研究上先后经历了哪几种范式:
A.实验科学
B.数据密集型科学
C.理论科学
D.计算科学
正确答案:A、B、C、D你选对了提问
13
多选(3分)
大数据带来思维方式的三个转变是:
A.相关而非因果
B.精确而非全面
C.全样而非抽样
D.效率而非精确
正确答案:A、C、D你选对了提问
14
多选(3分)
大数据主要有哪几种计算模式:
A.查询分析计算
B.图计算
C.流计算
D.批处理计算
正确答案:A、B、C、D你选对了提问
15
多选(3分)
云计算的典型服务模式包括三种:
A. IaaS
B.PaaS
C.SaaS
D.MaaS
正确答案:A、B、C你选对了
1
单选(2分)
启动hadoop所有进程的命令是:
A.start-hdfs.sh
B.start-dfs.sh
C.start-all.sh
D.start-hadoop.sh
正确答案:C你选对了提问
2
单选(2分)
以下对Hadoop的说法错误的是:
A.Hadoop的核心是HDFS和MapReduce
B.Hadoop2.0增加了NameNode HA和Wire-compatibility两个重大特性
C.Hadoop MapReduce是针对谷歌MapReduce的开源实现,通常用于大规模数据集的并行计算
D.Hadoop是基于Java语言开发的,只支持Java语言编程
正确答案:D你选对了提问
3
单选(2分)
以下哪个不是Hadoop的特性:
A.高可靠性
B.支持多种编程语言
C.成本高
D.高容错性
正确答案:C你选对了提问
4
单选(2分)
以下名词解释不正确的是:
A.Hive:一个基于Hadoop的数据仓库工具,用于对Hadoop文件中的数据集进行数据整理、特殊查询和分析存储
B.HBase:提供高可靠性、高性能、分布式的行式数据库,是谷歌BigTable的开源实现
C.HDFS:分布式文件系统,是Hadoop项目的两大核心之一,是谷歌GFS的开源实现
D.Zookeeper:针对谷歌Chubby的一个开源实现,是高效可靠的协同工作系统
正确答案:B你错选为D提问
5
多选(3分)
以下哪些组件是Hadoop的生态系统的组件:
A.MapReduce
B.HBase
C.HDFS
D. Oracle
正确答案:A、B、C你选对了提问
6
多选(3分)
以下哪个命令可以用来操作HDFS文件:
A.hdfs dfs
B.hdfs fs
C.hadoop dfs
D.hadoop fs
正确答案:A、C、D你选对了
1
单选(2分)
HDFS的命名空间不包含:
A.目录
B.字节
C.文件
D.块
正确答案:B你选对了提问
2
单选(2分)
对HDFS通信协议的理解错误的是:
A.客户端与数据节点的交互是通过RPC(Remote Procedure Call)来实现的
B.名称节点和数据节点之间则使用数据节点协议进行交互
C.客户端通过一个可配置的端口向名称节点主动发起TCP连接,并使用客户端协议与名称节点进行交互
D.HDFS通信协议都是构建在IoT协议基础之上的
正确答案:D你选对了提问
3
单选(2分)
采用多副本冗余存储的优势不包含:
A.容易检查数据错误
B.节约存储空间
C.加快数据传输速度
D.保证数据可靠性
正确答案:B你选对了提问
4
单选(2分)
假设已经配置好环境变量,启动Hadoop和关闭Hadoop的命令分别是:
A.start-dfs.sh,stop-hdfs.sh
B.start-hdfs.sh,stop-hdfs.sh
C.start-dfs.sh,stop-dfs.sh
D.start-hdfs.sh,stop-dfs.sh
正确答案:C你选对了提问
5
单选(2分)
分布式文件系统HDFS采用了主从结构模型,由计算机集群中的多个节点构成的,这些节点分为两类,一类存储元数据叫 ,另一类存储具体数据叫 :
A.名称节点,主节点
B.数据节点,名称节点
C.名称节点,数据节点
D.从节点,主节点
正确答案:C你选对了提问
6
单选(2分)
下面关于分布式文件系统HDFS的描述正确的是:
A.分布式文件系统HDFS比较适合存储大量零碎的小文件
B.分布式文件系统HDFS是Google Bigtable的一种开源实现
C.分布式文件系统HDFS是谷歌分布式文件系统GFS(Google File System)的一种开源实现
D.分布式文件系统HDFS是一种关系型数据库
正确答案:C你选对了提问
7
多选(3分)
以下对名称节点理解正确的是:
A.名称节点作为中心服务器,负责管理文件系统的命名空间及客户端对文件的访问
B.名称节点用来负责具体用户数据的存储
C.名称节点通常用来保存元数据
D.名称节点的数据保存在内存中
正确答案:A、C、D你选对了提问
8
多选(3分)
以下对数据节点理解正确的是:
A.数据节点通常只有一个
B.数据节点在名称节点的统一调度下进行数据块的创建、删除和复制等操作
C.数据节点用来存储具体的文件内容
D.数据节点的数据保存在磁盘中
正确答案:B、C、D你选对了提问
9
多选(3分)
HDFS只设置唯一一个名称节点带来的局限性包括:
A.命名空间的限制
B.隔离问题
C.性能的瓶颈
D.集群的可用性
正确答案:A、B、C、D你选对了提问
10
多选(3分)
以下HDFS相关的shell命令不正确的是:
A.hadoop fs -ls <path>:显示<path>指定的文件的详细信息
B.hadoop fs -copyFromLocal <path1> <path2>:将路径<path2>指定的文件或文件夹复制到路径<path1>指定的文件夹中
C.hdfs dfs -rm <path>:删除路径<path>指定的文件
D.hadoop dfs mkdir <path>:创建<path>指定的文件夹
正确答案:B、D你选对了
1
单选(2分)
HBase是一种 数据库
A.行式数据库
B.文档数据库
C.列式数据库
D.关系数据库
正确答案:C你选对了提问
2
单选(2分)
下列对HBase数据模型的描述错误的是:
A.每个HBase表都由若干行组成,每个行由行键(row key)来标识
B.HBase列族支持动态扩展,可以很轻松地添加一个列族或列
C.HBase中执行更新操作时,会删除数据旧的版本,并生成一个新的版本
D.HBase是一个稀疏、多维度、排序的映射表,这张表的索引是行键、列族、列限定符和时间戳
正确答案:C你选对了提问
3
单选(2分)
下列说法正确的是:
A.如果不启动Hadoop,则HBase完全无法使用
B.HBase的实现包括的主要功能组件是库函数,一个Master主服务器和一个Region服务器
C.如果通过HBase Shell插入表数据,可以插入一行数据或一个单元格数据
D.Zookeeper是一个集群管理工具,常用于分布式计算,提供配置维护、域名服务、分布式同步等
正确答案:D你选对了提问
4
单选(2分)
在HBase数据库中,每个Region的建议最佳大小是:
A.100MB-200MB
B.500MB-1000MB
C.2GB-4GB
D.1GB-2GB
正确答案:D你选对了提问
5
单选(2分)
HBase三层结构的顺序是:
A.-ROOT-表,Zookeeper文件,.MEATA.表
B.Zookeeper文件,-ROOT-表,.MEATA.表
C..MEATA.表,Zookeeper文件,-ROOT-表
D.Zookeeper文件,.MEATA.表,-ROOT-表
正确答案:B你选对了提问
6
单选(2分)
客户端是通过 级寻址来定位Region:
A.二
B.三
C.一
D.四
正确答案:B你选对了提问
7
单选(2分)
关于HBase Shell命令解释错误的是:
A.list:显示表的所有数据
B. create:创建表
C.put:向表、行、列指定的单元格添加数据
D.get:通过表名、行、列、时间戳、时间范围和版本号来获得相应单元格的值
正确答案:A你选对了提问
8
多选(3分)
下列对HBase的理解正确的是:
A.HBase是一种关系型数据库,现成功应用于互联网服务领域
B.HBase是一个行式分布式数据库,是Hadoop生态系统中的一个组件
C. HBase是针对谷歌BigTable的开源实现
D.HBase多用于存储非结构化和半结构化的松散数据
正确答案:C、D你选对了提问
9
多选(3分)
HBase和传统关系型数据库的区别在于哪些方面:
A.数据索引
B.数据模型
C.存储模式
D. 数据操作
正确答案:A、B、C、D你选对了提问
10
多选(3分)
访问HBase表中的行,有哪些方式:
A.通过某列的值区间
B.全表扫描
C.通过一个行健的区间来访问
D.通过单个行健访问
正确答案:B、C、D你选对了
1
单选(2分)
下列关于NoSQL数据库和关系型数据库的比较,不正确的是:
A.NoSQL数据库很容易实现数据完整性,关系型数据库很难实现数据完整性
B.NoSQL数据库具有弱一致性,关系型数据库具有强一致性
C.NoSQL数据库缺乏统一的查询语言,而关系型数据库有标准化查询语言
D.NoSQL数据库的可扩展性比传统的关系型数据库更好
正确答案:A你选对了提问
2
单选(2分)
以下对各类数据库的理解错误的是:
A.图数据库灵活性高,支持复杂的图算法,可用于构建复杂的关系图谱
B.键值数据库的键是一个字符串对象,值可以是任意类型的数据,比如整型和字符型等
C.HBase数据库是列族数据库,可扩展性强,支持事务一致性
D.文档数据库的数据是松散的,XML和JSON 文档等都可以作为数据存储在文档数据库中
正确答案:C你选对了提问
3
单选(2分)
下列数据库属于文档数据库的是:
A.MongoDB
B.MySQL
C.HBase
D.Redis
正确答案:A你选对了提问
4
单选(2分)
NoSQL数据库的三大理论基石不包括:
A.CAP
B.ACID
C.BASE
D.最终一致性
正确答案:B你选对了提问
5
多选(3分)
关于NoSQL数据库和关系数据库,下列说法正确的是:
A.NoSQL数据库可以支持超大规模数据存储,具有强大的横向扩展能力
B.关系数据库有关系代数理论作为基础,NoSQL数据库没有统一的理论基础
C.NoSQL数据库和关系数据库各有优缺点,但随着NoSQL的发展,终将取代关系数据库
D.大多数NoSQL数据库很难实现数据完整性
正确答案:A、B、D你选对了提问
6
多选(3分)
NoSQL数据库的类型包括:
A.键值数据库
B.文档数据库
C.图数据库
D.列族数据库
正确答案:A、B、C、D你选对了提问
7
多选(3分)
CAP是指:
A.可用性
B.持久性
C.分区容忍性
D.一致性
正确答案:A、C、D你选对了提问
8
多选(3分)
NoSQL数据库的BASE特性是指:
A.最终一致性
B.软状态
C.持续性
D.基本可用
正确答案:A、B、D你选对了
1
单选(2分)
下列Amazon的云数据库属于关系数据库的是:
A.Amazon DynamoDB
B.Amazon SimpleDB
C.Amazon Redshift
D.Amazon RDS
正确答案:D你选对了提问
2
单选(2分)
下列关于UMP系统的说法不正确的是:
A.Controller服务器向UMP集群提供各种管理服务,实现集群成员管理、元数据存储等功能
B.Agent服务器部署在运行MySQL进程的机器上,用来管理每台物理机上的MySQL实例
C.Mnesia是UMP系统的一个组件,是一个分布式数据库管理系统,且不支持事务
D.UMP系统是低成本和高性能的MySQL云数据库方案
正确答案:C你错选为D提问
3
多选(3分)
UMP依赖的开源组件包括:
A.RabbitMQ
B.LVS
C.Mnesia
D.ZooKeeper
正确答案:A、B、C、D你选对了提问
4
多选(3分)
在UMP系统中,Zookeeper主要发挥的作用包括:
A.作为全局的配置服务器
B.提供分布式锁,选出一个集群的“总管”
C.监控所有MySQL实例
D.负责集群负载均衡
正确答案:A、B、C你选对了提问
5
多选(3分)
UMP系统设计了哪些机制来保证数据安全:
A.记录用户操作日志
B.数据访问IP白名单
C.SSL数据库连接
D.SQL拦截
正确答案:A、B、C、D你选对了
1
单选(2分)
下列说法错误的是:
A.不同的Map任务之间不能互相通信
B.MapReduce框架采用了Master/Slave架构,包括一个Master和若干个Slave
C.Hadoop框架是用Java实现的,MapReduce应用程序则一定要用Java来写
D.Map函数将输入的元素转换成<key,value>形式的键值对
正确答案:C你选对了提问
2
单选(2分)
在使用MapReduce程序WordCount进行词频统计时,对于文本行“hello hadoop hello world”,经过WordCount程序的Map函数处理后直接输出的中间结果,应该是下面哪种形式:
A.<"hello",<1,1>>、<"hadoop",1>和<"world",1>
B.<"hello",2>、<"hadoop",1>和<"world",1>
C.<"hello",1,1>、<"hadoop",1>和<"world",1>
D.<"hello",1>、<"hello",1>、<"hadoop",1>和<"world",1>
正确答案:D你选对了提问
3
单选(2分)
对于文本行“hello hadoop hello world”,经过WordCount的Reduce函数处理后的结果是:
A. <"hello",<1,1>><"hadoop",1><"world",1>
B.<"hello",1,1><"hadoop",1><"world",1>
C.<"hello",2><"hadoop",1><"world",1>
D.<"hello",1><"hello",1><"hadoop",1><"world",1>
正确答案:C你选对了提问
4
多选(3分)
下列关于传统并行计算框架(比如MPI)和MapReduce并行计算框架比较正确的是:
A.前者是共享式(共享内存/共享存储),容错性差,后者是非共享式的,容错性好
B.前者适用于实时、细粒度计算、计算密集型,后者适用于批处理、非实时、数据密集型
C.前者相比后者学习起来更难
D.前者所需硬件价格贵,可扩展性差,后者硬件便宜,扩展性好
正确答案:A、B、C、D你选对了提问
5
多选(3分)
MapReduce1.0的体系结构主要由哪几个部分组成:
A.Task
B.Client
C.JobTracker
D.TaskTracker
正确答案:A、B、C、D你选对了
1
单选(2分)
下列说法正确的是:
A.第二名称节点是热备份
B.HDFS HA可用性不好
C.HDFS HA提供高可用性,可以实现可扩展性、系统性能和隔离性
D.第二名称节点无法解决单点故障问题
正确答案:D你选对了提问
2
单选(2分)
HDFS Federation设计不能解决“单名称节点”存在的哪个问题:
A.性能更高效
B.良好的隔离性
C.HDFS集群扩展性
D.单点故障问题
正确答案:D你选对了提问
3
多选(3分)
下列哪些是Hadoop1.0存在的问题:
A.开发者自己管理作业之间的依赖关系
B.表达能力有限
C.执行迭代操作效率低
D.抽象层次低
正确答案:A、B、C、D你选对了提问
4
多选(3分)
下列对Hadoop各组件的理解正确的是:
A.Kafka:分布式发布订阅消息系统
B.Tez:支持DAG作业的计算框架
C.Pig:处理大规模数据的脚本语言
D.Oozie:工作流和协作服务引擎
正确答案:A、B、C、D你选对了提问
5
多选(3分)
对新一代资源管理调度框架YARN的理解正确的是:
A.YARN的体系结构包含三个组件:ResourceManager,NodeManager,ApplicationMaster
B.YARN既是资源管理调度框架,也是一个计算框架
C.YARN可以实现“一个集群多个框架”,即在一个集群上部署一个统一的资源调度管理框架
D.MapReduce2.0是运行在YARN之上的计算框架,由YARN来为MapReduce提供资源管理调度服务
正确答案:A、C、D你选对了
1
单选(2分)
下列有关Hive和Impala的对比错误的是:
A.Hive在内存不足以存储所有数据时,会使用外存,而Impala也是如此
B.Hive适合于长时间的批处理查询分析,而Impala适合于实时交互式SQL查询
C.Hive与Impala使用相同的元数据
D.Hive与Impala中对SQL的解释处理比较相似,都是通过词法分析生成执行计划
正确答案:A你选对了提问
2
单选(2分)
下列关于Hive基本操作命令的解释错误的是:
A.create table if not exists usr(id bigint,name string,age int);//如果usr表不存在,创建表usr,含三个属性id,name,age
B.load data local inpath ‘/usr/local/data’ overwrite into table usr; //把目录’/usr/local/data’下的数据文件中的数据以追加的方式装载进usr表
C.create database userdb;//创建数据库userdb
D.insert overwrite table student select * from user where age>10; //向表usr1中插入来自usr表的age大于10的数据并覆盖student表中原有数据
正确答案:B你选对了提问
3
多选(3分)
下列说法正确的是:
A.数据仓库Hive不需要借助于HDFS就可以完成数据的存储
B.HiveQL语法与传统的SQL语法很相似
C.Hive本身不存储和处理数据,依赖HDFS存储数据,依赖MapReduce处理数据
D.Impala和Hive、HDFS、HBase等工具可以统一部署在一个Hadoop平台上
正确答案:B、C、D你选对了提问
4
多选(3分)
Impala主要由哪几个部分组成:
A.Hive
B.CLI
C.State Store
D.Impalad
正确答案:B、C、D你选对了提问
5
多选(3分)
以下属于Hive的基本数据类型是:
A.TINYINT
B.STRING
C.FLOAT
D.BINARY
正确答案:A、B、C、D你选对了
1
单选(2分)
Spark SQL目前暂时不支持下列哪种语言:
A.Java
B.Scala
C.Python
D.Lisp
正确答案:D你选对了提问
2
单选(2分)
RDD操作分为转换(Transformation)和动作(Action)两种类型,下列属于动作(Action)类型的操作的是:
A.map
B.groupBy
C.count
D.filter
正确答案:C你选对了提问
3
单选(2分)
下列说法错误的是:
A.RDD提供的转换接口既适用filter等粗粒度的转换,也适合某一数据项的细粒度转换
B.Spark支持三种类型的部署方式:Standalone,Spark on Mesos,Spark on YARN
C.RDD采用惰性调用,遇到“转换(Transformation)”类型的操作时,只会记录RDD生成的轨迹,只有遇到“动作(Action)”类型的操作时才会触发真正的计算
D.在选择Spark Streaming和Storm时,对实时性要求高(比如要求毫秒级响应)的企业更倾向于选择流计算框架Storm
正确答案:A你选对了提问
4
单选(2分)
下列关于常见的动作(Action)和转换(Transformation)操作的API解释错误的是:
A.map(func):将每个元素传递到函数func中,并将结果返回为一个新的数据集
B.count():返回数据集中的元素个数
C.take(n):返回数据集中的第n个元素
D.filter(func):筛选出满足函数func的元素,并返回一个新的数据集
正确答案:C你选对了提问
5
单选(2分)
下列大数据处理类型与其对应的软件框架不匹配的是:
A.基于实时数据流的数据处理:Storm
B.复杂的批量数据处理:MapReduce
C.基于历史数据的交互式查询:Impala
D.图结构数据的计算:Hive
正确答案:D你选对了提问
6
多选(3分)
Apache软件基金会最重要的三大分布式计算系统开源项目包括:
A.Oracle
B.Storm
C.Spark
D.Hadoop
正确答案:B、C、D你错选为A、B、D提问
7
多选(3分)
Spark的主要特点包括:
A.运行速度快
B.运行模式多样
C.容易使用
D.通用性好
正确答案:A、B、C、D你选对了提问
8
多选(3分)
下列关于Scala的说法正确的是:
A.Scala是一种多范式编程语言
B.Scala具备强大的并发性,支持函数式编程
C.Scala运行于Java平台,兼容现有的Java程序
D.Scala是Spark的主要编程语言,但Spark还支持Java、Python、R作为编程语言
正确答案:A、B、C、D你选对了提问
9
多选(3分)
Spark的运行架构包括:
A.每个工作节点上负责具体任务的执行进程 Executor
B.每个应用的任务控制节点 Driver
C.集群资源管理器 Cluster Manager
D.运行作业任务的工作节点 Worker Node
正确答案:A、B、C、D你选对了
1
单选(2分)
流计算秉承一个基本理念,即数据的价值随着时间的流逝而 ,如用户点击流:
A.不确定
B.升高
C.降低
D.不变
正确答案:C你选对了提问
2
单选(2分)
Hadoop运行的是MapReduce任务,类似地,Storm运行的任务叫做
A.Bolt
B.Tuple
C.Topology
D.Spout
正确答案:C你选对了提问
3
多选(3分)
对于一个流计算系统来说,它应达到如下哪些需求:
A.高性能
B.分布式
C.海量式
D.实时性
正确答案:A、B、C、D你选对了提问
4
多选(3分)
数据采集系统的基本架构包括哪些部分:
A.Collector
B.Controller
C.Agent
D.Store
正确答案:A、C、D你选对了提问
5
多选(3分)
以下哪些是开源的流计算框架:
A.Twitter Storm
B.Yahoo! S4
C.IBM InfoSphere Streams
D.Facebook Puma
正确答案:A、B你选对了提问
6
多选(3分)
下面哪几个属于Storm中的Stream Groupings的分组方式:
A.按照字段分组
B.随机分组
C.广播发送
D.全局分组
正确答案:A、B、C、D你选对了
1
单选(2分)
以下哪个不是Flink的优势:
A.支持有状态计算
B.同时支持高吞吐、低延迟、高性能
C.不支持增量迭代
D.同时支持流处理和批处理
正确答案:C你选对了提问
2
单选(2分)
在Flink中哪个是基于批处理的图计算库:
A.SQL&Table库
B.FlinkML
C.CEP
D.Gelly
正确答案:D你选对了提问
3
多选(3分)
下面关于Flink的说法正确的是:
A.Flink可以同时支持实时计算和批量计算
B.Flink起源于Stratosphere 项目,该项目是在2010年到2014年间由柏林工业大学、柏林洪堡大学和哈索普拉特纳研究所联合开展的
C.Flink不是Apache软件基金会的项目
D.Flink是Apache软件基金会的5个最大的大数据项目之一
正确答案:A、B、D你选对了提问
4
多选(3分)
Flink的主要特性包括:
A.精密的状态管理
B.事件时间支持
C.精确一次的状态一致性保障
D.批流一体化
正确答案:A、B、C、D你选对了提问
5
多选(3分)
下面论述正确的是:
A.Storm虽然可以做到低延迟,但是无法实现高吞吐,也不能在故障发生时准确地处理计算状态
B.Spark Streaming通过采用微批处理方法实现了高吞吐和容错性,但是牺牲了低延迟和实时处理能力
C.流处理架构需要具备低延迟、高吞吐和高性能的特性,而目前从市场上已有的产品来看,只有Flink可以满足要求
D.Flink实现了Google Dataflow流计算模型,是一种兼具高吞吐、低延迟和高性能的实时流计算框架,并且同时支持批处理和流处理
正确答案:A、B、C、D你选对了提问
6
多选(3分)
Flink常见的应用场景包括:
A.数据流水线应用
B.数据分析应用
C.地图应用
D.事件驱动型应用
正确答案:A、B、D你选对了提问
7
多选(3分)
Flink核心组件栈分为哪三层:
A.Runtime核心层
B.Core层
C.物理部署层
D.API&Libraries层
正确答案:A、C、D你选对了提问
8
多选(3分)
Flink有哪几种部署模式:
A.Local模式
B.YARN集群模式
C.Standalone集群模式
D.运行在GCE(谷歌云服务)和EC2(亚马逊云服务)上
正确答案:A、B、C、D你选对了提问
9
多选(3分)
Flink系统主要由两个组件组成,分别为:
A.JobManager
B.TaskScheduler
C.JobScheduler
D.TaskManager
正确答案:A、D你选对了提问
10
多选(3分)
在编程模型方面,Flink 提供了不同级别的抽象,以开发流或批处理作业,主要包括哪几个级别的抽象:
A.状态化的数据流接口
B. SQL
C.Table API
D.DataStream API(有界或无界流数据)以及 DataSet API(有界数据集)
正确答案:A、B、C、D你选对了
1
单选(2分)
Pregel是一种基于 模型实现的并行图处理系统:
A.SBP
B.TSP
C.BSP
D.STP
正确答案:C你选对了提问
2
单选(2分)
谷歌在后Hadoop时代的新“三驾马车”不包括:
A.Caffeine
B.Pregel
C.Dremel
D.Hama
正确答案:D你选对了提问
3
多选(3分)
下列哪些是以图顶点为中心的,基于消息传递批处理的并行图计算框架:
A.Hama
B.Giraph
C.Pregel
D.Neo4j
正确答案:A、B、C你选对了提问
4
多选(3分)
以下关于Pregel图计算框架说法正确的是:
A.Pregel采用检查点机制来实现容错
B.通常只对满足交换律和结合律的操作才会开启Combiner功能
C.对于全局拓扑改变,Pregel采用了惰性协调机制
D.Aggregator提供了一种全局通信、监控和数据查看的机制
正确答案:A、B、C、D你选对了
1
单选(2分)
下列说法错误的是:
A.ItemCF算法推荐的是那些和目标用户之前喜欢的物品类似的其他物品
B.UserCF算法推荐的是那些和目标用户有共同兴趣爱好的其他用户所喜欢的物品
C.基于用户的协同过滤算法(简称UserCF算法)是目前业界应用最多的算法
D.UserCF算法的推荐更偏向社会化,而ItemCF算法的推荐更偏向于个性化
正确答案:C你选对了提问
2
多选(3分)
推荐方法包括哪些类型:
A.基于内容的推荐
B.专家推荐
C.基于统计的推荐
D.协同过滤推荐
正确答案:A、B、C、D你选对了
更多推荐
所有评论(0)