Advertisement

PCA推导算法

阅读量:

PCA理解与应用。

Motivation

  • 在功能上两者具有显著的相似性,在主要目的均在于降低数据维度。
  • 相比之下,在概念上 PCA 更为简洁明了。
  • PCA 的核心目标则是识别出数据所处的主要低维子空间。
    举个例子来说,在实际应用中我们经常遇到的数据往往存在高度相关性的属性。
    这些冗余性意味着如果我们直接采用原始数据进行建模训练的话可能会受到维度灾难的影响,
    并可能导致计算负担加重以及模型过拟合的风险。

算法流程

数据预处理

在本节中所述的方法中,在第一部分我们将对原始数据集进行标准化处理以消除各指标间的量纲差异

推导

PCA有多种推导方式,最直观的方式是最大方差和最小平方误差。

最大方差理论

在信号处理领域通常认为信号表现出显著的差异性而噪声则呈现出较低的程度因此信噪比被定义为信号与噪声之间的差异性之比并且这一数值越高越好。

一种直观的想法是,在将m维的feature space投影至feature subspace的过程中(即将其降维至m-1维),我们期望使其方差最大化地得以保留下来(以便尽可能多地保持数据间的差异性)。

将样本投影至新的单位向量空间u中,在此空间中样本与原点的距离即为x^Tu。为了实现这一目标,在寻找最优解的过程中需要确保经过该变换后数据的分布特性能够得到充分展现。具体

全部评论 (0)

还没有任何评论哟~