采用交叉验证法进行分析
发布时间
阅读量:
阅读量
在机器学习的相应研究过程中,若采用的是有监督类算法,通常需要将初始数据集划分为两个部分,分别为训练集与测试集。训练集中的样本包含标签信息,通过这些数据构建模型,使机器能够识别不同类别之间的差异,并利用该模型对测试集中样本的标签进行预测。随后将预测结果与实际标签进行对比,即可评估模型的预测准确率。实际上,这一过程是对模型泛化能力的检验,即从训练集中归纳出的规律是否能够适用于其他未见过的数据。
那么,在划分训练集和测试集时应考虑哪些因素呢?主要涉及以下两个方面:
-
训练集所包含的数据量需足够丰富,通常应超过原始数据集的一半规模,否则所总结出的规律可能过于局限
-
两部分数据必须是原始数据集合的均衡抽样,否则会出现诸如训练集中仅包含某一类样本而测试集中则全是另一类样本的情况。这种情况下模型虽然能掌握第一类样本的特点,但在面对第二类样本时却难以做出准确判断。
因此,交叉验证的核心目标在于: 系统性地评估模型泛化能力的表现水平。
交叉验证方法主要包括三种类型:双折交叉验证、K折交叉验证以及留一法交叉验证。
(1) double CV
其基本原理为:将每个类别对应的数据集均等划分为两个部分,随后从每个类别中选取其中一部分进行组合,作为训练集,而剩余部分则用作测试集。完成首轮训练后,将训练集与测试集的位置进行互换,再次开展训练过程。通过这种方式可实
全部评论 (0)
还没有任何评论哟~
