A method for regression analysis with variable selection and regularization (Lasso)
发布时间
阅读量:
阅读量
本内容源自coursera,欢迎各位进行交流与转载。
特征选择方法探讨
- 效率
- 具有实际价值
- 稀疏特征
1.1法一:全部子集
首先确定仅包含单一特征的最优特征,随后依次增加至两个特征,依此类推。

假定存在从0到D的特征集合,鉴于每个特征均存在被纳入或未被纳入两种可能性,因此该算法的复杂度表现为 2^{(D+1)}(此数值表示可能生成的模型种类数量,不涵盖各模型内部计算与预测过程所涉及的复杂程度)。
1.2法二:贪心算法
每次从尚未被选取的特征集合中挑选出最优的一个特征。
算法复杂度分析如下:
第一阶段:构建D个模型
第二阶段:构建D-1个模型
……
……
……
综上所述,该算法的时间复杂度为O{(D^2)}
2正规化(regularization)
回顾此前提及的岭回归方法,我们期望\hat{w}的数值能够尽量减小。进一步思考,若希望计算过程更加简便,那么我们倾向于让其中的部分项变为零,这样最终获得的模型
全部评论 (0)
还没有任何评论哟~
