Advertisement

DeViSE is a dense VS-EM model.

阅读量:

摘要

当前视觉识别系统所面临的能力限制在于其难以应对目标类别数量的大幅增长。

  • 扩展至大量目标类别
  • 文本数据
  • 在本文中,我们构建了一种全新的深度视觉-语义嵌入模型
  • 利用未标注文本中提取的语义信息与带有标签的图像数据进行训练。
  • 在包含1000个类别的ImageNet目标识别任务中进行验证

介绍

artificially assigning images to a small
number of rigidly defined classes

Previous Work

当前图像分类领域中领先的解决方案包括:

  • 构建一个深度卷积神经网络,其输出层采用softmax函数实现多项逻辑回归
  • 然而,从罕见概念中获取足够数量的训练样本正变得愈发具有挑战性
  • WSABIE
  • 一种融合图像与标签的联合嵌入模型
  • 实施方式:采用在线学习排序算法
  • 探索了从图像特征到嵌入空间的线性映射关系
  • 图像表示空间:用于表达图像特征的向量空间
  • 嵌入空间:将数据映射到低维向量空间的过程
  • 均方误差准则:用于衡量预测值与真实值之间差异的标准
  • 八种类别的分类任务:即8-way cl

全部评论 (0)

还没有任何评论哟~