Advertisement

Multi-Domain CNN for Visual Tracking 论文笔记

阅读量:

摘要内容提炼

本文设计了一种依托于卷积神经网络的视觉追踪方法。该方法通过多个带有标注信息的视频数据,学习目标物体共通的特征表达,从而实现对目标的追踪功能。
网络架构由两部分构成:共享层与多个针对特定领域设计的分支层。
在训练阶段,采用若干视频共同训练共享层,每个视频被视作一个独立领域,并分别训练对应的特定领域层。
在测试阶段(即面对新的视频时),使用已训练完成的共享层与新增的二分类层组成新的网络结构。该二分类层能够在线更新,用于判断从上一帧目标区域随机采样的候选窗口是否为目标对象。
该方法在当前主流的跟踪测试集上展现出出色的性能表现。

1 介绍

近年来,卷积神经网络(CNN)被广泛应用于多种计算机视觉任务,例如图像分类、语义分割以及物体检测等。CNN之所以能够取得巨大成功,主要得益于其在处理可视化数据时展现出的优异性能。然而,在视觉跟踪领域,这种趋势的影响相对有限,这主要是由于视频处理应用中难以获取大量训练数据,并且专门针对视觉跟踪任务的训练算法尚未成熟。尽管如此,基于手工提取低级特征的方法在实际应用中仍表现出良好的效果。为了解决数据不足的问题,最近一些跟踪算法尝试通过迁移学习的方式,在大规模分类数据集(如ImageNet)上预训练的CNN模型进行优化。虽然这些方法可以在一定程度上获得通用的特征表示,但由于分类任务与跟踪任务之间存在本质上的

全部评论 (0)

还没有任何评论哟~