Image captioning improvement using policy gradient optimization for SPIDEr metric, Paper Record
发布时间
阅读量:
阅读量
此次是我首次完整地从了解直至推导完成一篇论文,而非以往的浅尝辄止,因此特地记录下这篇理论层面并不复杂,但叙述方式极具吸引力且富有学习价值的文章。
本内容共分为三个部分,第一部分为论文报告内容 ,第二部分为在汇报过程中所暴露出的自身不足之处以及对论文信息的进一步补充 ,最终部分则用于分享,附上论文链接 ,并列举一些我在阅读过程中偶然发现的优质文章 。
一、论文报告
1.Introduction
1.1 Image Caption背景信息:
1、Image Caption问题可以表述为由图像与目标词序列构成的二元组(I,S),其中I代表图像,S表示目标词序列,即S={S_1,S_2,…},每个S_t均从数据集中提取的词汇组成。训练的目标在于最大化条件概率p(S|I),从而使得生成的句子尽可能贴近目标句子,亦即通过精准的语言描述图像内容。在Image Caption任务中,多数方法依赖于统计学手段,在图像与字幕之间构建概率匹配模型,例如最大似然估计(MLE)。
2、在机器翻译领域,存在若干用于评估图像标注效果的标准指标:BLEU、METEOR、ROUGE和CIDEr,统称为“BCMR”。COCO数据集正是采用这四个指标来衡量算法性能优劣。
3、借助上述指标对Image Caption进
全部评论 (0)
还没有任何评论哟~
