Advertisement

机器学习中的PCA:主成分分析(第1章 算法原理)

阅读量:

目录

一、PCA基本概念

二、PCA实际案例分析与计算过程

三、PCA常规操作步骤

四、PCA要点归纳


一、PCA简介

主成分分析作为当前广泛采用的一种无监督学习技术,其核心原理是通过正交变换手段,将原本由多个线性相关变量构成的观测数据集,转化为由少量线性无关变量所表达的新数据集。这些线性无关的变量在统计学中被定义为主成分。由于主成分的数量一般会少于原始变量的数量,因此该方法本质上是一种降维技术。

首先必须指出的是,在空间几何中,一组线性无关的向量之间具有相互垂直的特性。因此,在确定了降维后数据表示所对应的向量方向之后,其余维度的方向也变得相对明确。具体而言,只需要从该向量所对应的m个正交向量中挑选出k个线性无关的向量即可。换句话说,就是重新构建一组正交基(x1,x2,x3......xk)(k<m),而这组基中的每个向量都应尽可能保留原始数据中的信息。

随后需要解决的问题是如何确定这些向量的具体方向。为了最大限度地保留原始数据的信息内容,我们希望在新设定的方向上,原始数据的投影能够呈现出更高的分散程度。而在衡量数据分散程度方面,有一个非常熟悉的统计指标——方差。

\large s^{2}=\frac{\sum_{i=1}^{n}(X_{i}-\overline{X})^{2}}{n-1}

从公式可以看出,方差数值越高,则意味着

全部评论 (0)

还没有任何评论哟~