Advertisement

VTN:视频Transformer网络

阅读量:

该技术方案可与当前主流的backbone架构相融合,从而赋予其卓越的视频分类与理解能力,例如将ViT/DeiT与VTN相结合便展现出显著优势!训练效率提升了16.1倍,实际运行速度也提高了5.1倍,相关代码及预训练模型即将对外公开!

注1:文末附有【Transformer

在这里插入图片描述

本研究提出了一种名为VTN的视频识别模型,该模型是以Transformer架构为基础构建的。在受到视觉Transformer领域最新进展的启发后,我们摒弃了传统依赖3D卷积神经网络进行视频动作识别的常规手段,转而引入一种新的分类策略,该策略通过全面分析整个视频序列的信息来实现对动作的识别。

在这里插入图片描述

所提出的技术方案具有广泛的适用性,能够基于任意指定的二维空间网络架构进行构建。从

全部评论 (0)

还没有任何评论哟~