Advertisement

回归分析用于变量选择和预测

阅读量:

我眼中的回归变量筛选

变量筛选 是构建回归模型过程中至关重要的一环,由于各变量之间存在一定的关联性,因此不同的筛选手段往往会导致最终形成的模型有所差异。

在众多变量筛选方法中,向前选择法、向后剔除法以及逐步回归法 被广泛采用,主要因其操作简便、计算效率高,具有较强的实用性。通过这些方法所挑选出的变量,在被纳入模型后,其表现通常较为接近最优状态。

然而 ,由上述方法选出的变量所构建的模型未必能够达到真正的最优水平。若希望获得更优的模型结构,则需要对所有可能的X组合进行尝试,以找出最佳的变量组合方式,这种方法被称为全子集选择法 。不过由于计算复杂度较高及运算速度等方面的限制,该方法在实际应用中存在一定的局限性,通常只适用于样本量较小且变量数量有限的情形。

此外,还有其他技术可以与回归分析相结合以实现变量筛选的目标。例如Lasso算法 ,它适用于处理具有稀疏系数特征的回归问题。比如,在自变量总数为200的情况下,若其中大量自变量之间存在高度相关性,并且仅有10个左右的自变量对结果有显著影响,则这种稀疏性可以通过Lasso算法来识别并完成有效的变量筛选。

实际上,并不存在一种能够在建模初期就直接获取最高效变量组合的方法。在实际操作中,我会首先对数据集进行小规模抽样或初步的粗略筛选,在降低自变量数量之后再运用全子集选择法进一步

全部评论 (0)

还没有任何评论哟~