谷歌的Hinton团队提出了Pix2seq:一种语言模型用于目标检测
发布时间
阅读量:
阅读量
Pix2Seq:一种简洁且具有广泛适用性的目标检测新框架,其通过将目标检测任务转化为语言建模问题,有效简化了处理流程,其性能可与Faster R-CNN以及DETR相媲美。此外,该框架还具备拓展至其他相关任务的潜力。
注1:这种感觉与去年看到DETR时颇为相似,当时同样没有直接对标当前最优方法,而是与里程碑式成果进行比较。因此,在未来一两年内,是否应将计算机视觉领域视为自然语言处理的一部分来研究,或者实现某种形式的大一统趋势?
注2:文末附有【Transformer
Pix2seq
Pix2seq: A Language Modeling Framework for Object Detection

单位:谷歌大脑(Geoffrey Hinton等)
论文下载链接:https://arxiv.org/abs/2109.10852
本研究提出了一种名为Pix2Seq的目标检测框架,该框架具有简洁且广泛适用的特性。

还没有任何评论哟~
