[论文解读] S-CLIP: Semi-supervised Vision-Language Learning using Few Specialist Captions
S-CLIP 提出了一种半监督视觉-语言预训练方法,利用少量配对的图像-文本字幕和大量未配对的图像,提升 CLIP 在专业领域中的表现。该方法通过最优传输生成字幕级别的伪标签,并通过部分标签学习实现关键词级别的伪标签,仅使用监督微调所需数据的三分之一,就在遥感基准上实现了 10% 的零样本准确率提升和 4% 的检索性能提升。
Vision-language models, such as contrastive language-image pre-training (CLIP), have demonstrated impressive results in natural image domains. However, these models often struggle when applied to specialized domains like remote sensing, and adapting to such domains is challenging due to the limited number of image-text pairs available for training. To address this, we propose S-CLIP, a semi-supervised learning method for training CLIP that utilizes additional unpaired images. S-CLIP employs two pseudo-labeling strategies specifically designed for contrastive learning and the language modality. The caption-level pseudo-label is given by a combination of captions of paired images, obtained by solving an optimal transport problem between unpaired and paired images. The keyword-level pseudo-label is given by a keyword in the caption of the nearest paired image, trained through partial label learning that assumes a candidate set of labels for supervision instead of the exact one. By combining these objectives, S-CLIP significantly enhances the training of CLIP using only a few image-text pairs, as demonstrated in various specialist domains, including remote sensing, fashion, scientific figures, and comics. For instance, S-CLIP improves CLIP by 10% for zero-shot classification and 4% for image-text retrieval on the remote sensing benchmark, matching the performance of supervised CLIP while using three times fewer image-text pairs.
研究动机与目标
- 提升在遥感等专业领域中的视觉-语言预训练性能,这些领域中大规模配对数据稀缺。
- 解决在视觉-语言模型中朴素伪标签法的局限性,即即使图像相似,其字幕也可能存在显著差异。
- 开发一种半监督学习框架,有效利用少量配对的图像-文本样本和大量未配对图像。
- 设计针对对比学习和语言模态的伪标签策略,确保对分布偏移和字幕多样性的鲁棒性。
- 在使用显著更少的标注图像-文本对的情况下,实现与全监督 CLIP 相当的性能。
提出的方法
- 通过求解未配对图像与配对图像之间的最优传输问题,生成字幕级别的伪标签,产生对已标注字幕的概率分布,以指导全局语义对齐。
- 从最近的已标注图像中构建关键词候选集,将任务视为部分标签学习,以建模局部视觉-语义组件。
- 结合两种伪标签目标:字幕级别用于图像-文本检索,关键词级别用于零样本分类,实现互补学习。
- 使用对比学习联合训练监督数据和伪标签数据,其中伪标签在训练过程中迭代优化。
- 通过基于视觉相似性的排序方式优化小批量采样,以提升伪标签质量和训练稳定性。
- 该方法避免依赖外部检测器或类别注释,使其适用于标注基础设施有限的领域。
实验结果
研究问题
- RQ1在仅有少量配对字幕和大量未配对图像的情况下,半监督学习能否显著提升专业领域中的视觉-语言模型性能?
- RQ2如何设计伪标签策略以应对图像字幕的高多样性与独特性,避免模型退化为最近字幕的简单分配?
- RQ3字幕级别和关键词级别伪标签在多大程度上能协同提升零样本分类和图像-文本检索性能?
- RQ4在标注数据与未标注数据之间存在分布偏移的情况下,基于最优传输的字幕伪标签是否优于朴素的最近字幕分配?
- RQ5当缺乏精确标签监督时,关键词的部分标签学习是否能提升模型泛化能力?
主要发现
- 与标准 CLIP 微调相比,S-CLIP 在 RSICD 遥感基准上将零样本分类准确率提升了 10%,图像-文本检索性能提升了 4%。
- S-CLIP 仅使用三分之一的图像-文本对,即可达到全监督 CLIP 的性能水平,展现出强大的数据效率。
- 消融实验证实,字幕级别和关键词级别伪标签均具有显著贡献,两者结合效果最佳。
- 经过排序的小批量采样使零样本准确率提升 1.5%,检索性能提升 0.6%,表明信息量更丰富的批量组成具有优势。
- 基线消融分析表明,关键词信息和半监督学习各自独立贡献,联合使用时达到 70.6% 的零样本准确率和 10.1% 的检索性能。
- 即使缺少类别名称,该方法依然有效,因为 94.8% 的字幕包含超过两个关键词,验证了部分标签学习的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。