Advertisement

Recursive Random Feature Elimination (随机递归特征消除)

阅读量:

随机递归特征消除

1、背景介绍

我们的数据集中可能包含大量特征,在剔除了一些明显无用或无效的特性后,在试图使模型达到最佳性能的情景中,则通常还需要完成一个特性的筛选过程。本质上这是一个搜索问题;我们需要确定哪些是最关键的特性和合适的数量。

每个特征有两种处理方式:保留或移除。这样就会产生2^n - 1个非空子集,在n较大时遍历所有这些子集及其相互比较变得不可行。有多种算法可以用来寻找这个最优解,在这里不做详细讨论。

其中一种简单有效的策略就是recursive feature elimination(RFE),它是一种基于backward selection strategy的方法,在全集中逐步剔除特征直至满足停止条件。作为贪心算法的一种,在每次迭代中都会移除当前最小重要的1个或多个特征(对于RFE而言),而这些重要性指标通常由模型自行确定——例如在logistic regression模型中查看coef_属性,在基于树的模型如random forest中则可参考feature_importances_属性等指标值。不过这种做法似乎带有一种难以言说的玄学色彩:难道真的容易陷入local optimum吗?实际上很多时候local optimum已经足够理想了——毕竟谁又能确切知道global optimum究竟在哪里呢?与其费力去暴力穷举全部可能性不如

全部评论 (0)

还没有任何评论哟~