Advertisement

无监督:降维

阅读量:

1.前言

当输入样本x的维度上升时,无论采用何种机器学习算法,其训练所需的时间都将随之增长,学习过程也会变得更为复杂。例如,在一维空间中的{0,1}区间内存在5个训练样本的情况下,若在d维空间中以相同密度布置相同类型的训练样本,则最终的样本数量将增加至5^d个。如图所示:

一个用于描述高维空间的实例。当维度d数值较大的时候,获取并处理数量高达5^d的训练样本将变得极为艰难。

正因如此,在高维空间中,训练样本通常以稀疏的方式进行设置。

例如,当维度d=10时,总的样本数量已经达到了5^10(≈10000000)的数量级。如此庞大的样本规模,使得数据的采集与计算过程变得异常复杂和困难。因此,在高维空间中,人们往往选择以稀疏的形式来安排训练样本。

此外,相较于低维空间而言,高维空间在直观理解上存在更大的挑战性,难以形成清晰的认知印象。

总体而言,处理高维数据的过程存在诸多难题,这种现象通常被称为“维度灾难”。为了解决这一问题,并使机器学习算法摆脱其影响,常用的有效手段是保留输入数

全部评论 (0)

还没有任何评论哟~