随机森林OOB score用于评估特征重要性
发布时间
阅读量:
阅读量
目录
1. oob
2. oob_score
3. oob选择重要特征
4.与其它方法对比
基于监督学习的方法(Random Forest),可以根据输入数据筛选出最佳特征,并消除特征之间的冗余;同样地,在分析不同排列组合的情况下,可以选择最优的组合方式以优化下游算法的效果。
原理:基于Boostrap方法生成随机决策树的过程,并非所有样本都会被用于单棵树生成;未被使用的部分被称为(out_of_bag)oob袋外样本。通过这些袋外样本可以评估该单棵树的准确性;此外,在构建其他子树时也遵循这一原理;最终将各子树结果取平均得到整个随机森林算法的整体性能。
特征选择原理:基于袋外样本的存在这一事实,在不执行交叉验证测试的情况下就可以实现模型优化(节省时间)。具体而言,在逐一给定模型中的每一个特徵赋以一个虚拟数值后观察模型性能的变化情况:如果某个特徵赋值后的模型表现发生显著波动,则可以推断该特徵具有重要意义。在scikit-learn库中会将每个特徵赋予权重值这一机制实现这一功能;权重值越高,则表示该特徵的影响越大。基于这些计算结果我们可以按照其权重大小排序后选取最优的特徵集合。
在掌握随机森林算法的参数解释与最优选择过程中时有体会的是:oob_score这一特定参数是否反映了使用袋外样本来评估模型效果的关键因素
1. oob
o
全部评论 (0)
还没有任何评论哟~
