Advertisement

模型评价:如何在机器学习与建模中解决过拟合问题

阅读量:

上一篇博客链接: 机器学习与建模中 - 判断数据模型拟合效果的三种方法

在前一篇博客中,我们探讨了利用损失函数评估模型的拟合程度。然而,拟合效果良好的模型未必就是最优的模型,建模的核心目标在于预测能力,因此预测精度最高的模型才应被视为最佳选择。

谈及预测能力,我们需要引入一个新概念——“泛化能力”(泛化能力指的是机器学习算法对未见过的新样本进行适应的能力。学习的目标在于从数据中提取隐藏的规律,并且对于遵循相同规律但未参与训练的数据集,经过训练后的模型也应能做出合理的输出)。

以多项式回归为例(如下图所示),面对相同的训练数据集,8阶多项式的损失值远低于1阶多项式。然而,在对未来数据进行预测时,8阶多项式的表现却极为不理想(如下右图所示)。这是因为8阶多项式模型过度关注于训练数据(即出现过拟合现象),从而难以有效适应新的输入数据。

为解决过拟合问题并提升模型的泛化能力,通常采用以下四种途径:

途径一:引入验证集

途径二:应用交叉验证技术

途径三:对K折交叉验证进行计算优化

途径四:去除噪声数据


方法一:验证集

为解决过拟合现象

全部评论 (0)

还没有任何评论哟~