论文复现了VGG架构的讲解与实现,并进行了基于迁移学习的自定义数据集训练。
发布时间
阅读量:
阅读量
论文链接,我对这篇论文的详细内容未加深入研究,仅了解了文章的整体架构。
但是需要注意的是:
在训练阶段中提供给ConvNets作为输入的是经过固定大小(224×224像素)RGB图像的数据集样本。具体的预处理操作是将每个像素值减去训练数据集中计算得到的平均RGB值(例如VGG16网络中使用的VGG_MEAN = tf.constant([123.68, 116.779, 103.939], dtype=tf.float32))。这一预处理步骤完成后会将图像转换为BGR格式并进行后续处理。随后通过一系列卷积转换层对图像进行特征提取:采用的是具有极小感知域的滤波器(如3×3尺寸),这种尺寸能够有效捕捉局部特征并提取关键信息点。为了保证卷积操作后的图像空间分辨率不被压缩,在卷积过程中采用了单位填充策略(即填充量为1个像素)。随后由五个最大池化层依次执行降采样操作,并伴随一定的转换操作以优化特征表示能力。值得注意的是并非所有转换过程都会紧跟最大池化层;最大池化操作基于2×2像素窗口执
全部评论 (0)
还没有任何评论哟~
