Advertisement

A method for regression analysis with variable selection and regularization (Lasso)

阅读量:

本内容源自coursera,欢迎各位进行交流与转载。

特征选择方法探讨

  • 效率
    • 具有实际价值
    • 稀疏特征

1.1法一:全部子集

首先确定仅包含单一特征的最优特征,随后依次增加至两个特征,依此类推。

这里写图片描述

假定存在从0到D的特征集合,鉴于每个特征均存在被纳入或未被纳入两种可能性,因此该算法的复杂度表现为 2^{(D+1)}(此数值表示可能生成的模型种类数量,不涵盖各模型内部计算与预测过程所涉及的复杂程度)。

1.2法二:贪心算法

每次从尚未被选取的特征集合中挑选出最优的一个特征。

算法复杂度分析如下:
第一阶段:构建D个模型
第二阶段:构建D-1个模型
……
……
……
综上所述,该算法的时间复杂度为O{(D^2)}

2正规化(regularization)

回顾此前提及的岭回归方法,我们期望\hat{w}的数值能够尽量减小。进一步思考,若希望计算过程更加简便,那么我们倾向于让其中的部分项变为零,这样最终获得的模型

全部评论 (0)

还没有任何评论哟~