Advertisement

FLIP:缩放语言-图像预训练通过遮蔽

阅读量:

一句话总结

该研究引入了Fast Language-Image Pre-training (FLIP)模型。该方法相较于现有技术具有更高的效率,并且在复杂场景下表现更为稳定。

点击链接访问

在这里插入图片描述

FLIP

在这里插入图片描述

Scaling Language-Image Pre-training via Masking

单位:Meta AI, FAIR(何恺明等人)

论文:https://arxiv.org/abs/2212.00794

我们采用了一种有意识地遮蔽并去除大部分图像patches的方法,在同一wall-clock time内从中提取更多image-text pairs,并在相同内存使用量下每批次处理更多样本。

![在这里插入图片描述](https://ad.itadn.com/c/weblog/blog-img/images/2025-05-3

全部评论 (0)

还没有任何评论哟~