Advertisement

机器学习的基证分析

阅读量:

模型选择问题(Model Selection Problem)

此前我们了解到,单纯通过最小化Ein来挑选最优模型并非正确做法,这种策略可能导致模型复杂度增加、泛化能力下降以及出现过拟合现象。
为应对这一问题,我们设想借助测试数据来评估不同模型的表现,然而若使用全新的测试数据进行此操作,实际上是一种自我欺骗的手段,并不可行。
我们对这两种方法进行了比较:若以训练数据作为选择依据,由于这些数据本身决定了最终的假设结果,在用其进行验证时已受到“污染”;而采用新数据进行测试验证,则具有“清洁”的特性。
因此折中的处理方式是,从现有数据中预留一小部分作为验证集,在模型选择过程中再将其用于评估效果。

验证

当前,我们从所持有的数据集中划出一部分作为验证集,用以模拟测试数据的情形。为实现将验证集上的错误率Eval与Eout进行关联,期望这部分数据能够独立且同分布于原始数据集的分布特征;其余部分则作为训练集,可用于模型的选择过程。

全部评论 (0)

还没有任何评论哟~