[论文解读] Is a Caption Worth a Thousand Images? A Controlled Study for Representation Learning
该论文对仅图像对比学习(SimCLR)与CLIP风格的图文对比学习进行了受控比较,表明当预训练数据量大、描述性强且变异性低时,语言监督能显著提升迁移性能;然而,在数据量少或图像描述质量差的场景下,语言监督反而会损害性能。作者提出了数据过滤和描述增强方法,以提升CLIP在真实场景中的实用性。
The development of CLIP [Radford et al., 2021] has sparked a debate on whether language supervision can result in vision models with more transferable representations than traditional image-only methods. Our work studies this question through a carefully controlled comparison of two approaches in terms of their ability to learn representations that generalize to downstream classification tasks. We find that when the pre-training dataset meets certain criteria -- it is sufficiently large and contains descriptive captions with low variability -- image-only methods do not match CLIP's transfer performance, even when they are trained with more image data. However, contrary to what one might expect, there are practical settings in which these criteria are not met, wherein added supervision through captions is actually detrimental. Motivated by our findings, we devise simple prescriptions to enable CLIP to better leverage the language information present in existing pre-training datasets.
研究动机与目标
- 解决关于语言监督是否相比仅图像方法能提升视觉表征学习的争议。
- 通过消除架构、数据分布和训练目标等混淆因素,隔离语言监督的影响。
- 识别决定语言监督是否有助于或损害表征学习的数据集属性——规模、描述性与描述变异性。
- 开发实用干预措施,通过提升预训练描述的质量与一致性来改善CLIP的性能。
提出的方法
- 使用相同的模型架构、损失函数和训练协议,对SimCLR(仅图像)与CLIP(图文)进行直接对比。
- 采用相同的自监督对比学习目标:对齐正样本对(如增强后的图像或描述),同时与负样本对比。
- 在不同数据集(如MS-COCO、YFCC)上训练模型,评估其在下游迁移任务中的表现,这些数据集的描述质量与变异性各不相同。
- 使用基于文本的分类器过滤低质量描述,并利用预训练语言模型对描述进行改写与增强,以提升一致性。
- 通过在标准下游视觉基准(如ImageNet、Food101、Cifar100)上进行线性探测来评估表征性能。
- 提出CLIP${}_{\text{S}}$,一种改进的CLIP变体,通过在描述上应用数据增强以减轻变异性影响。
实验结果
研究问题
- RQ1在受控条件下,语言监督是否能带来比仅图像对比学习更具迁移性的视觉表征?
- RQ2数据集规模、描述描述性与描述变异性如何影响CLIP相较于仅图像模型的性能?
- RQ3在何种实际场景中,尽管具有理论优势,语言监督仍会降低模型性能?
- RQ4简单的数据级干预措施(如描述过滤与改写)能否提升CLIP的下游迁移性能?
主要发现
- 当预训练数据量大且包含高度描述性、低变异性描述时,CLIP的表现优于SimCLR,即使SimCLR在更大规模的图像数据上进行训练。
- 一个高质量的描述性描述(如来自MS-COCO)在下游迁移性能方面,约相当于五个低质量、未经筛选的描述(如来自YFCC)。
- 在低数据量场景或描述高度变异性的情况下,语言监督在分布内和分布外均会降低模型性能。
- 由于风格或词汇差异导致的描述变异性会负面影响CLIP的性能,尤其当同一图像存在多个不一致的描述时。
- 通过改写实现的文本数据增强可降低模型对描述变异性敏感度,从而提升CLIP的鲁棒性与迁移准确率。
- 使用文本分类器过滤低质量描述可显著提升下游线性探测准确率,尤其在Cifar100和Food101等高难度基准上。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。