Advertisement

Feature Selection - Shadow Variable Search

阅读量:

为了提升模型性能,在数据集中增加原始特征的置换副本。这些置换后的副本被称为影子变量或伪变量。置换操作破坏了它们与目标变量之间的任何关系,因此在预测中毫无价值。随后的搜索过程类似于逐步前向选择算法,在算法的每次迭代中添加一个新的特征。这个新特征被选为能够最大程度提升模型性能的那个特征。由于这一过程需要对尚未包含在内的每个特征训练一个模型以进行比较评估而显得非常耗时。与逐步前向选择法不同的是影子变量搜索采用将搜索终止于发现最优秀的影子变量作为停止标准的方法来实现这一目标。一旦选择了一个影子变量就意味着最佳改进是通过添加一个与目标变量无关的新特征求得的;因此那些尚未被选中的其他候选变量很可能只是由于随机因素而与目标变量存在关联性而非真实的相关性作用于系统中

复制代码
 library(mlr3verse)

    
  
    
 #no control parameters
    
 optimizer = fs("shadow_variable_search")
    
  
    
 task = tsk("pima")
    
  
    
 #The data set contains missing values.
    
 task$missings()
    
  
    
 #impute the missing values
    
 learn

全部评论 (0)

还没有任何评论哟~