学习通|机器学习练习题
目录
练习四
练习一
1 监督学习是根据已有的数据集中(输入特征)和输出标签(Label)之间的关系
2 分类问题的目标是预测 ( 类别标签)
3 回归问题的目标是预测 ( 一组连续值)
4 不收敛一般出现在(基于梯度下降)算法的模型中
5 数据清洗(Data Cleaning)的主要思想是通过填补缺失值,光滑噪声数据,平滑或删除离群点,并解决(数据的一致性)问题
6 属于机器学习分类:监督学习、半监督学习、无监督学习、强化学习。
7 属于机器学习的算法:回归算法、正则化算法、基于树的算法、贝叶斯方法。
8 属于机器学习的范围是:统计学习、数据挖掘、计算机视觉、语音识别。
9 欠拟合的原因有:模型复杂度过低、数据特征少。
10 降维的两种主要方法:投影、流型学习。
练习二
1 数据变换包括对数据进行规范化、(离散化)、稀疏化处理,达到适用于挖掘的目的。
2 信息增益可以衡量某个(特征)对分类结果的影响大小。
3 在构建决策树选择特征时,应选择(基尼指数增益值最大)的特征,作为该结点分裂条件。
4 如果在特征较多的情况下,一般使用(Lasso)回归。
5 决策树学习常见的算法包括:CART、ID3、C4.5、 随机森林。
6 停止构造决策树的条件:决策树的深度达到指定的条件;规定最小节点数。
7 K-Means聚类它对聚类中心的平均值的使用很简单。正确
8 降维将使得机器学习的算法运行更快。正确
9 决策树学习的目标就是把数据集按对应的类别标签进行分类。正确
10 决策树是使用最广泛的机器学习模型之一,因为决策树可以很好地处理噪声或丢失的数据,并且可以很容易地进行整合,以形成更强大的预测器(集成方法常采用决策树作。正确
练习三
1 线性模型的主要参数是(正则化参数)
2 逻辑回归假设因变量y服从(伯努利分布)
3 线性回归假设因变量y服从(高斯分布)
4 支持向量机(Support Vector Machine,SVM)是一个非常强大的机器学习模型,能够执行:线性和非线性的分类、回归、异常值检测, 它是机器学习中最流行的模型之一。
5 常用的核函数有哪些:线性核函数、多项式核函数、高斯径向核函数。
6 神经网络是一种多层前馈神经网络,该网络的主要特点是信号前向传递,误差反向传播。主要包括(隐藏层、输入层、输出层)每一层的神经元状态影响下一层神经元状态。
7 Alpha值较大或C值较小,说明模型比较简单。正确
8 逻辑回归(Logistic Regression)模型是一个红黑树模型。错误
9 逻辑回归与线性回归都是一种广义线性模型(Generalized Linear Model)。正确
10 SVM支持分类和回归。正确
练习四
1 predict_proba的输出是每个类别的(概率),通常比 decision_function的输出更容易理
解。
2 RBM是一种简单的深度学习架构,是一组(无监督)的特征学习算法,它根据数据的概率模型学习一定数量的新特征,往往在使用RBM之后用线性模型(线性回归、逻辑回归、感知机等)的效果极佳。概念上,RBM 是一个浅层(2层)的神经网络,属于深度信念网络。
3 利用传统语法创建管道较为麻烦,Pipeline类提供了一个很方便的函数 (make_pipeline),可以创建管道并根据每个步骤所属的类为其自动命名。如果多个步骤属于同一类,则会自动附加一个数字。
4 由于现实世界获取信息和数据的过程中,会存在各类的原因导致数据丢失和空缺。针对这些缺失值的处理方法,主要是基于变量的分布特性和变量的重要性(信息量和预测能力)采用不同的方法。属于该方法的有(插值法填充、删除变量、模型填充)。
5 数据变换包括对数据进行(离散化、规范化、稀疏化处理)达到适用于挖掘的目的。
6 best_estimator_本质上是个管道,它包含两个步骤(StandardScaler、LogisticRegression)。
7 多层感知机MLP的精度相当好,但没有其他模型好,与较早的SVC例子相同,原因可能在于数据的收敛。错误
8 神经网络要求所有输入特征的变化范围相似,最理想的情况是均值为0、方差为1,为此,将数据进行缩放以满足这些要求。正确
9 噪声是变量的随机误差和方差,是观测点和真实点之间的误差,即 obs=.xE。正确
10 文本处理一般在NLP(自然语言处理)领域应用最为广泛,一般都是需要把文本进行向量化,最为常见的方法有词袋法(Bag of Words)、CountVectorizer 、TF-IDF。正确
更多推荐
所有评论(0)