ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

机器学习期末复习

机器学习期末复习 机器学习选择题名词解释简答题计算题一、线性回归二、决策树三、贝叶斯选择题机器学习利用经验 须对以下进行分析A 天气 B 数据 C 生活 D 语言归纳偏好值指机器学习算法在学习的过程中对以下的偏好A 数据 B 某种类型假设 C 标记 D 运行速度有的情况下 模型学习到了训练数据满足的特有性质但这些性质不是一般规律这种现象被称为A 欠拟合 B 过拟合 C 欠配 D 以上三个选项都不是最小二乘法估计 得到的线性回归模型 满足性质A 均方模型为 0 B 均方误差偏大 C 均方误差偏小 D 均方误差为 1下列是决策树的预测过程。A 将测试示例从一个中间节点开始沿着划分属性所构成的“判定测试序列”下行知道叶节点、B 将测试实例从一个中间节点开始沿着划分属性所构成的“判定测试序列”上行直到根节点。C 将测试示例从叶节点开始沿着划分属性 所构成的“判定测试序列”上行直 到根节点。D 将测试示例从根节点开始沿着划分属性所构成的“判定测试序列”下行直到叶节点。BP 算法基于策略对参数进行调整A 梯度下降 B 梯度上升 C 最小化误差 D 误差逆传播当训练样本线性不可划分时可采用来缓解和解决A 增加正例样本 B 核函数 C 训练误差最小 D 测试误差最小朴素贝叶斯分类器中对给定类别模型对所有属性间的独立性有A 部分不独立 B 部分独立 C 相互不独立 D 相互独立KNNL 近邻算法属于一种典型的算法A 监督学习 B 无监督学习 C 半监督学习 D 弱监督缓解维数灾难的操作是A 降维 B 升维 C 低维度嵌入 D 流型处理决策树属于(模型。-A.判别式 B.生成式 C判别式和生成式 D.以上都不对先对联合概率分布P(x, c)建模再由此获得P(clx),属于模型。A.判别式 B.生成式 C.回归 D. 以上都不是贝叶斯公式中估计后验概率P(c|x)的主要困难在于估计(。A. Pc B. P(x|c) C.以上两者都是 D.以上两者都不是下列()方法可以用来获得从原始数据集中划分出“测试集”?A.留出法 B.交叉验证法 C.自助法 D.以上三个选项都可以在训练集上的误差被称作)A.泛化误差 B.经验误差 C.测试误差 D.以上三个选项都不对当西瓜收购公司去瓜摊l收购西瓜时既希望把好瓜都收走J尽可能的少请问他应该考虑()评价指标?A.精度 B.查全率 C.查准率 D.F1度量信息嫡是度量样本集合()最常用的一种指标。A.纯度 B.对称差 C.大小 D.重要性在属性划分中信息增益越大结点的纯度 )。A.不变B.变为零C.提升越大D.降低越快剪枝是决策树学习算法对付(现象的主要手段。A.标记噪声B.数据少C.过拟合D.欠拟合多层感知机表示异或逻辑时最少需要个隐含层仅考虑二元入。A. 1 B. 2 C. 3 D. 4答案BBBCD ABDAA ABBDB DACCB名词解释奥卡姆剃刀原则 是一种科学原则在解释现象时应该选择最简单的解释和假设归纳偏好 是指在遇到不完全信息或不确定性情况下人们对于潜在解释或假设的倾向和偏好线性模型 是一种常见的机器学习模型用于建立输入特征与输出变量之间的线性关系线性回归是一种常见的线性模型用于建立输入特征与连续输出变量之间的线性关系最小二乘法 是一种常用的拟合方法最小化预测值与真实值之间的残差平方和来确定模型的参数类别不平衡 是指在分类问题中不同类别的样本数量存在较大差异决策树 是一种常见的机器学习算法主要用于回归和分类任务通过创建一个树形结构将复杂的任务分解成一系列简单的决策分支进而解决复杂的分类和回归问题。通常用于有监督的学习可以训练数据集进行学习和预测神经网络 是一种模拟脑部神经系统的模型由大量人工神经元相互连接构成。通过模拟神经元之间的连接和信息传递来实现复杂的信息处理神经元之间连接的权重可以通过学习算法来进行调整以使得神经网络可以学习和适应不同的任务和数据间隔margin 是指支持向量机中分类器的决策边界与最近的分类样本之间的距离间隔越大泛化能力越强贝叶斯决策论是一种基于概率统计理论的决策方法通过计算不同决策的期望损失来选择最优的决策用于处理分类问题急切学习 一种机器学习的方法在训练阶段就构造一个模型进行学习并用它进行预测懒惰学习与急切学习相反简答题1.机器学习是人工智能的一种分支让计算机从数据中学习和改进以完成某种任务目标是让计算机在经验中学习自动发现模式和规律并运用规律进行预测和决策2.过拟合及缓解方法指模型在训练数据集上表现良好但在新数据或测试集上表现不好的现象。通常是由于模型过于复杂使得模型在训练的过程中过分注重与特定细节而没有真正掌握数据的底层结构和一般规律缓解方法增加训练数据量提供更多的数据样本供模型学习减少过拟合的风险降低模型的复杂度减少模型的自由度或者通过正则化限制模型的学习能力3.有监督和无监督学习有监督的学习是指模型在训练数据中每个样本都有对应的标签和目标输出模型通过学习输入与输出的映射关系进行预测和决策无监督的学习是指模型在训练数据中每个样本没有对应的标签和目标输出模型通过学习数据的内在结构和相似性进行聚类、降维或异常检测等任务4.查准率和查全率查准率又称精确率是指在预测为正类的样本中真正类所占的比例衡量分类模型在某一分类预测上的准确性。查全率又称召回率是指在实际为正类的样本中真正类所占的比例衡量分类模型在某一分类预测上的完整性。5.P-R曲线怎么对学习器进行比较P-R曲线是以R查全率为横轴P查准率为纵轴绘制的曲线。通过改变分类的阈值来得到不同的P-R点比较不同学习器的性能可以通过曲线下的面积AUC越接近1越好或者F1-score来判断6.真正例率和假正例率真正例率TPR是表示实际为正例的样本中被正确预测为正例的比例TPRTP/TPFN假正例率FPR是表示实际为负例的样本中 被错误预测为正例的比例FPRFP/FPTN7.简述线性判别分析LDALDA的主要思想是选择一个投影方向将数据投影使得相同类别的数据尽可能紧凑不同类别的数据尽可能分开步骤①计算类内散度矩阵和类间散度矩阵②计算投影方向③降维8.决策树对过拟合的主要手段是什么该手段的优缺点是什么主要手段是剪枝预剪枝的优点是计算效率高和避免过拟合缺点是容易信息丢失导致欠拟合后剪枝的优点是包括更好的泛化能力和不容易欠拟合缺点是计算开销大容易过拟合9.简述M-P神经元模型的组成及每一部分的作用M-P神经元是由输入部分和激活函数构成输入部分接收外部输入信号并赋予每个输入相应的权重激活函数会根据输入信号的加权和是否超过神经元的阈值来决定是否激活神经元10.神经网络对于过拟合的有效手段正则化通过在损失函数中加入正则化如L1正则化或L2正则化以惩罚模型的复杂度防止模型过度拟合数据早停法通过在训练中监控验证集的性能表现当模型性能不再提升时停止训练防止模型过度拟合数据11.卷积神经网络CNN的结构和作用输入层接收原始数据卷积层提取特征激活函数增加非线性池化层减少特征图尺寸全连接层将特征进行分类和回归卷积神经网络结构有输入层、卷积层、激活函数、池化层、全连接层12.支持向量机的基本型和稀疏性解释包括线性SVM和非线性SVM min w,b 1/2||w||²稀疏性指在训练数据时只有少量数据成为支持向量只有少数样本对模型有影响作用13.朴素贝叶斯分类器和半朴素贝叶斯分类器区别区别在于两者对于数据样本处理的特征依赖关系不同朴素贝叶斯分类器假设特征之间相互独立半朴素贝叶斯分类器允许特征之间存在一定的依赖关系14.聚类算法和性能度量聚类算法将数据样本划分为不同的类别或簇同一类别的样本相似度较高不同类别的相似度较低。性能度量是检测聚类算法的质量包括聚类准确度、轮廓系数等聚类准确度是指分类正确的样本占样本总数的比例轮廓系数是指簇内紧密度和簇间分离度的平衡程度计算题一、线性回归1什么是“线性回归”目的找到一条直线或一个平面或更高维的超平面使得预测值与真实值之间的误差最小化。2给出单一属性的线性回归目标函数。3若用最小二乘法求解线性回归模型给出最小二乘法的闭式解w和b及其推导过程。二、决策树1简述决策树学习的目标并列举两种度量样本集合纯度最常用的指标。目标在训练数据集上构建一棵决策树使得该决策树能够对新的未知数据进行分类或回归预测同时保证分类或预测的准确性。指标举例基尼指数、信息增益。2“信息熵”是度量样本集合纯度最常用的一种指标假定当前样本集合D中第k类样本所占的比例为pkk12…∣Y∣写出D的信息熵Ent(D)的公式表达。3假定离散属性a有V个可能的取值{a1,a2,…,aV}使用a来对样本集D进行划分写出属性a对样本集合D进行划分所获得的信息增益的公式表达。Gain(D,a)Ent(D)- ∑p(v)*Ent(D_v)4以属性“根蒂”为例其对应的3个数据子集分别为D1(根蒂蜷缩)D2(根蒂稍蜷)D3(根蒂硬挺)分别写出计算Ent(D1)、Ent(D2)和Ent(D3)的过程。D1(根蒂蜷缩)有8个其中正例5个反例3个D2(根蒂稍蜷)有7个其中正例3个反例4个D3(根蒂硬挺)有2个正例0个反例2个由此得出Ent(D1)-(5/8*log2(5/8)3/8*log2(3/8)Ent(D2)-(3/7*log2(3/7)4/7*log2(4/7)Ent(D3)-(0/2*log2(0/2)2/2*log2(2/2)三、贝叶斯两类的先验概率分别为0.8和0.2。现有一待识别的鱼其鱼的光泽度指标x从类条件概率密度分布曲线上查得鲈鱼P(x|c1) 0.15鲑鱼 P(x|c2) 0.5。1简述朴素贝叶斯分类器原理。朴素贝叶斯分类器基于贝叶斯定理与特征条件独立假设通过计算给定样本属于某个类别的概率选择概率最大的类别作为预测类别。2请给出后验概率P(c|x)和贝叶斯判定准则的具体式子。3使用贝叶斯决策对鱼的类别进行预测。P(c1|x)(0.8×0.15)/(0.8×0.150.2×0.5)0.12/(0.120.1)0.545P(c2|x)(0.2×0.5)/(0.8×0.150.2×0.5)0.1/(0.120.1)0.454由于P(c1|x)P(c2|x)根据贝叶斯判定准则将该鱼判定为鲈鱼。
返回列表