模型集成方法: stacked generation
发布时间
阅读量:
阅读量
Stacked generation分为两个阶段
1. Level-0 generalizers
Level-0 generalizers阶段生成Level-1 generalizers阶段的输入数据。
我们有K个简单的分类模型,在集成这些模型的结果时需要确定它们各自的权重值。一种方法是将训练集按照一定比例进行分割来训练这K个简单模型;然后使用这K个模型对剩下的部分进行预测,并将这些预测结果作为输入变量来训练目标变量为这部分真实值的线性回归模型;通过这种方法可以得到K个模型的权重系数。需要注意的是,在线性回归中要求自变量之间应尽量避免高度相关性;然而,在前一步骤中得到的预测结果之间可能存在较高的线性相关性。
为此需要进行一定程度的优化调整。通过交叉验证技术,在每一级训练阶段将当前样本的预测结果与剩余的数据集进行模型拟合。这样就能获得整个训练集上所有样本的一致性预测结果。其中使用分类概率表示能够更全面地反映各分类器的表现程度。此时每个测试样本会被映射为一个K维向量空间中的点。这些映射后的数据将作为Level-1的一般化器(Generalizer)的基础训练集,并且这些数据会用于生成新的模型版本以提升准确率和鲁棒性。而原始测试集中的每个样例则会通过使用这K个独立分类器,在包含所有原始训练数据的新模型中进行预测生成结果,并将这些结果同样构成一个K维向量集合,并用于构成Level
全部评论 (0)
还没有任何评论哟~
