Advertisement

YouTube-8M: Large-Scale Video Classification Benchmark Overview

阅读量:

YouTube-8M视频分类基准

Abstract

作者采用每秒1帧的速率对视频进行解码,并借助在ImageNet上预训练的深度卷积神经网络提取潜在的特征表示。

Introduction

研究者首先借助youtube视频标注系统对youtube-8m数据集实施标注操作,并结合人工审核机制与特定的过滤准则,对所生成的标签内容进行有效筛选。此外,研究者还指出,youtube-8m数据集具备庞大的数据规模与丰富的类别多样性,这在推动后续视频内容的理解及特征表示学习方面具有积极意义。

特征分析与提取方法

研究者对视频的前六分钟内容以每秒一帧的速率进行解码,并将这些数据输入至Inception网络中,提取其最后一层隐藏层经过ReLU激活后的输出作为特征表达。每秒钟的视频数据对应2048维的特征向量。与此同时,研究中去除了与动作相关的特征信息,相关实验结果表明,当视频在规模和多样性方面增加时,整体性能会出现下降趋势。

随后,研究人员采用了PCA结合白化处理的方式对数据实施压缩操作,并指出数据规模的变化仅会导致约1%的影响程度。

Models from Frame Features

针对frame-level特征的处理方式,研究者提出了三种可供借鉴的实现路径:logistic结合平均法、深度帧袋模型以及长短期记忆网络。

全部评论 (0)

还没有任何评论哟~