目录

练习一

练习二

练习三

练习四​​​​​​​


练习一

1 监督学习是根据已有的数据集中(输入特征)和输出标签(Label)之间的关系

2 分类问题的目标是预测 ( 类别标签)

3 回归问题的目标是预测 ( 一组连续值)

4 不收敛一般出现在(基于梯度下降)算法的模型中

5 数据清洗(Data Cleaning)的主要思想是通过填补缺失值,光滑噪声数据,平滑或删除离群点,并解决(数据的一致性)问题

6 属于机器学习分类:监督学习、半监督学习、无监督学习、强化学习

7 属于机器学习的算法:回归算法、正则化算法、基于树的算法、贝叶斯方法

8 属于机器学习的范围是:统计学习、数据挖掘、计算机视觉、语音识别

9 欠拟合的原因有:模型复杂度过低、数据特征少

10 降维的两种主要方法:投影、流型学习


练习二

1 数据变换包括对数据进行规范化、(离散化)、稀疏化处理,达到适用于挖掘的目的。

2 信息增益可以衡量某个(特征)对分类结果的影响大小。

3 在构建决策树选择特征时,应选择(基尼指数增益值最大)的特征,作为该结点分裂条件。

4 如果在特征较多的情况下,一般使用(Lasso)回归。

5 决策树学习常见的算法包括:CART、ID3、C4.5、 随机森林

6 停止构造决策树的条件:决策树的深度达到指定的条件;规定最小节点数。

7 K-Means聚类它对聚类中心的平均值的使用很简单。正确

8 降维将使得机器学习的算法运行更快。正确

9 决策树学习的目标就是把数据集按对应的类别标签进行分类。正确

10 决策树是使用最广泛的机器学习模型之一,因为决策树可以很好地处理噪声或丢失的数据,并且可以很容易地进行整合,以形成更强大的预测器(集成方法常采用决策树作。正确


练习三

1 线性模型的主要参数是(正则化参数

2 逻辑回归假设因变量y服从(伯努利分布

3 线性回归假设因变量y服从(高斯分布

4 支持向量机(Support Vector Machine,SVM)是一个非常强大的机器学习模型,能够执行:线性和非线性的分类回归异常值检测, 它是机器学习中最流行的模型之一。

5 常用的核函数有哪些:线性核函数、多项式核函数、高斯径向核函数

6 神经网络是一种多层前馈神经网络,该网络的主要特点是信号前向传递,误差反向传播。主要包括(隐藏层、输入层、输出层)每一层的神经元状态影响下一层神经元状态。

7 Alpha值较大或C值较小,说明模型比较简单。正确

8 逻辑回归(Logistic Regression)模型是一个红黑树模型。错误

9 逻辑回归与线性回归都是一种广义线性模型(Generalized Linear Model)。正确

10 SVM支持分类和回归。正确


练习四

1 predict_proba的输出是每个类别的(概率),通常比 decision_function的输出更容易理
解。

2 RBM是一种简单的深度学习架构,是一组(无监督)的特征学习算法,它根据数据的概率模型学习一定数量的新特征,往往在使用RBM之后用线性模型(线性回归、逻辑回归、感知机等)的效果极佳。概念上,RBM 是一个浅层(2层)的神经网络,属于深度信念网络。

3 利用传统语法创建管道较为麻烦,Pipeline类提供了一个很方便的函数 (make_pipeline),可以创建管道并根据每个步骤所属的类为其自动命名。如果多个步骤属于同一类,则会自动附加一个数字。

4 由于现实世界获取信息和数据的过程中,会存在各类的原因导致数据丢失和空缺。针对这些缺失值的处理方法,主要是基于变量的分布特性和变量的重要性(信息量和预测能力)采用不同的方法。属于该方法的有(插值法填充、删除变量、模型填充)。

5 数据变换包括对数据进行(离散化、规范化、稀疏化处理)达到适用于挖掘的目的。

6 best_estimator_本质上是个管道,它包含两个步骤(StandardScaler、LogisticRegression)。

7 多层感知机MLP的精度相当好,但没有其他模型好,与较早的SVC例子相同,原因可能在于数据的收敛。错误

8 神经网络要求所有输入特征的变化范围相似,最理想的情况是均值为0、方差为1,为此,将数据进行缩放以满足这些要求。正确

9 噪声是变量的随机误差和方差,是观测点和真实点之间的误差,即 obs=.xE。正确

10 文本处理一般在NLP(自然语言处理)领域应用最为广泛,一般都是需要把文本进行向量化,最为常见的方法有词袋法(Bag of Words)、CountVectorizer 、TF-IDF。正确

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐