Advertisement

论文笔记

阅读量:

视频理解算法具有多种应用场景

针对该问题而言

Motivation

这篇文章在introduction部分主要提出了两点motivation:

基于单帧的图像,在实际应用中通常可以获得较好的分类效果。然而,在连续帧之间的大量信息往往存在冗余性。因此,在ECO算法中仅考虑单一时间邻域内的图像信息。
为了建立长时期内图像帧之间的上下文关联关系,在ECO算法中仅依赖于简单的分数融合手段是不够有效的。相反地,则通过将较远时间间隔内的特征图层经过三维卷积操作实现端到端的特征融合。

相关工作

可以看出, ECO 的动机还是相对简单直接的, 在此基础上构建出网络也不算复杂。那么, ECO 与之前的行为识别方法有何不同呢? 作者在相关工作一节中进行了深入探讨。

  1. 大多数2stream类方法以及所有基于3D卷积的方法 都致力于学习短时程的时间序列特征,在视频级别的处理中通常会将连续的视频片段作为输入进行分类判断,在视频级别的处理中通常会对视频中的多个片段分别进行分类判断然后取平均得到最终结果 这种方式计算开销较大。
  2. 一些研究(例如去年deepmind提出的i3d模型 [2])倾向于通过延长单个clip的时间长度来获取更长的时间序列信息 但这种做法仍然无法有效处理较长的视频内容。
  3. 一些现有研究[3][4]采用了编码策略以生成视频级别的表示形式 但作者指出这种方

全部评论 (0)

还没有任何评论哟~