Advertisement

(降维, 度量)——周志华《机器学习》

阅读量:

降维与度量

特征空间的维度被称为维数,在机器学习领域也被视为当前数据科学中的一个重大挑战。其主要体现在:在面对高维数据时,样本分布趋于极度稀疏。具体而言,在满足训练样本密集采样的总体数量将远远超过人类可及的最大数值时(谓之触不可及者),这种稀疏性会导致学习器对未知数据的学习能力显著削弱。同时,在这种情况下计算过程异常繁琐——每一步都需要复杂的数学运算支持——这也是为什么支持向量机会选择使用核函数来实现从低维到高维空间的映射原因所在

通过降维策略来缓解维度灾难是一个关键途径。具体而言,在许多实际应用问题中尽管训练数据本身是高维度的但与学习任务相关的仅仅是其中的一个低维嵌入空间即所谓的低维嵌入。这种情况下我们可以通过特定的数学变换将原始高维空间映射到一个低维子空间中从而使得数据间的距离计算更加简便同时还能显著提升样本密度。这可能会有疑问:这样降维是否会丢失原始数据的一部分信息?事实上在很多实际问题中训练数据虽然是高维度的但由于其内在结构特征往往集中在某个低维度的空间里因此降维处理不仅不会丢失重要信息反而还能达到提炼优质属性并实现降噪的目的例如在数据属性中可能存在噪声属性相似属性或冗余属性等这些都需要通过特定方法进行筛选和处理

K近邻学习

k近邻算法又称为kNN(k-Nearest Neighbor),是一种成熟的监督学习方法,并且是机器学习领域中备受重视的经典算法之

全部评论 (0)

还没有任何评论哟~