机器学习 #7
发布时间
阅读量:
阅读量
在现实中许多机器学习问题都涉及上千维度甚至上万维度的特征空间,在这种情况下不仅会严重影响模型的训练效率通常还会导致难以寻找到令人满意的解决方案这类复杂的问题被称作维度灾难(curse of dimensionality)。
值得庆幸的是,在理论上降低维度的方法是可行的。例如,在MNIST数据集中绝大多数像素呈现白色特性,因此我们可以去除这些特征;而相邻像素之间具有高度的相关性,则意味着若将相邻像素压缩为一个像素时其带来的信息损失相对较小
需要注意的是,在进行降维操作时会不可避免地丢失一些信息;这可能导致性能略微下降;因此建议首先在原始维度上进行一次完整的训练;如果发现当前的训练速度不够理想,则可以考虑后续降维处理;尽管有时降维能够有效地去除噪声以及冗余细节;但这通常是例外而非常规情况;主要目的是为了加快整体的收敛速度
降维除了能在训练过程中提高效率之外,还可以应用于数据可视化。通过将高维度的数据降至二维或三维空间中去处理,则可以在二维(三维)空间中实现特征的映射与展示,并有助于直观地识别某些规律。
本节将介绍两种主要的降维方法(projection plus Manifold Learning),此外还会涵盖三种主流的技术:PCA、Kernel PCA和LLE。
一,维数灾难
在高维空间中观察到的现象与我们对低维空间的认知存在显著差异。举个例子来说,在单位正方形内
全部评论 (0)
还没有任何评论哟~
