FLIP:缩放语言-图像预训练通过遮蔽
发布时间
阅读量:
阅读量
一句话总结
该研究引入了Fast Language-Image Pre-training (FLIP)模型。该方法相较于现有技术具有更高的效率,并且在复杂场景下表现更为稳定。
点击链接访问

FLIP

Scaling Language-Image Pre-training via Masking
单位:Meta AI, FAIR(何恺明等人)
论文:https://arxiv.org/abs/2212.00794
我们采用了一种有意识地遮蔽并去除大部分图像patches的方法,在同一wall-clock time内从中提取更多image-text pairs,并在相同内存使用量下每批次处理更多样本。

还没有任何评论哟~
