Advertisement

深度学习入 --- 自学者的半监督学习指南

阅读量:

本章节内容借鉴自ufldl

1. 自我学习(Self-Taught Learning)与半监督学习的概念解析

首先,何为半监督学习?当面对大量未标注数据以及少量已标注数据时,这种情形即属于半监督学习的范畴。自我学习与半监督学习所适用的情境相似,但存在细微差异。

自我学习(self-taught learning)是一种更为广泛且具备更强适应性的学习方法,它并不要求未标注数据与已标注数据具有相同的分布特征。而半监督学习则不同,其前提条件是未标注数据和已标注数据需遵循一致的分布规律。以下通过实例说明两者的区别。

假设当前有一个计算机视觉任务,目标是识别图像中的汽车与摩托车;那么如何获取大量未标注的数据呢?最直接的方法可能是从互联网上下载一些随机的图像集合,并在这些图像上训练一个稀疏自编码器,从而提取出有效的特征信息。在此情境下,未标注数据相对于已标注数据而言呈现出完全不同的分布特征(例如,在未标注的数据集中可能存在部分汽车或摩托车图像,但并非全部)。这种情况被定义为自我学习。

反之,若存在大量未标注的图像数据,并且这些图像仅缺少类别标签(即没有明确标识每张图片是汽车还是摩托车),也可以利用这些未标注的数据来提取特征信息。这种方式要求未标记样本和带标记样本具有相同的分布特性,有时被称为半监督学习。然而在实际操作中,往往难以找到符合该条

全部评论 (0)

还没有任何评论哟~