昗思25天学习打卡营第十二天 Vision Transformer图像分类
发布时间
阅读量:
阅读量
Vision Transformer研究综述
Vision Transformer(ViT)的架构设计及其运行机制
ViT模型的主体结构是基于Transformer模型的Encoder部分

- 图像分块 :ViT首先对输入图像进行划分,将其拆分为多个固定尺寸的块(如16x16像素)。随后,每个图像块经过线性变换处理,生成具有固定维度的向量表示,这些向量将作为后续Transformer编码器的输入数据。
- 位置嵌入 :鉴于Transformer模型本身无法直接识别序列中元素的位置关系,ViT通过引入可训练的位置嵌入来解决这一问题。位置嵌入是一个与图像块嵌入维度一致的向量集合,其中每一项对应于特定位置的信息。通过将该位置信息与图像块的嵌入结果相加,模型得以识别并利用图像中不同区域的空间特征。
- Transformer编码器 :ViT模型的关键部分为Transformer编码器,其主要任务是对已嵌入的图像块序列进行处理和分析。该编码器由若干层结构相同的编码单元堆叠构成,每层均包含自注意力机制与前馈神经
全部评论 (0)
还没有任何评论哟~
