[论文解读] Robust Cross-Modal Representation Learning with Progressive Self-Distillation
本文提出一种渐进式自蒸馏框架,用于鲁棒的跨模态表征学习,通过在训练过程中动态生成软图像-文本对齐目标,以处理网络采集数据集中存在噪声的多对多对应关系。通过在训练周期间蒸馏自身知识,该方法在不增加额外计算成本的前提下,提升了零样本分类、线性探测和检索性能,相较于CLIP展现出更强的分布偏移鲁棒性,并且性能随数据规模增长而提升。
The learning objective of vision-language approach of CLIP does not effectively account for the noisy many-to-many correspondences found in web-harvested image captioning datasets, which contributes to its compute and data inefficiency. To address this challenge, we introduce a novel training framework based on cross-modal contrastive learning that uses progressive self-distillation and soft image-text alignments to more efficiently learn robust representations from noisy data. Our model distills its own knowledge to dynamically generate soft-alignment targets for a subset of images and captions in every minibatch, which are then used to update its parameters. Extensive evaluation across 14 benchmark datasets shows that our method consistently outperforms its CLIP counterpart in multiple settings, including: (a) zero-shot classification, (b) linear probe transfer, and (c) image-text retrieval, without incurring added computational cost. Analysis using an ImageNet-based robustness test-bed reveals that our method offers better effective robustness to natural distribution shifts compared to both ImageNet-trained models and CLIP itself. Lastly, pretraining with datasets spanning two orders of magnitude in size shows that our improvements over CLIP tend to scale with number of training examples.
研究动机与目标
- 为解决CLIP在噪声网络采集数据集中因假设图像-文本一一对应关系而产生的数据与计算效率低下问题。
- 通过建模负样本之间的语义相似性,提升跨模态表征学习的鲁棒性,而CLIP忽略了这一点。
- 开发一种自蒸馏框架,动态生成软对齐目标,无需外部监督或噪声数据修正。
- 在保持推理效率的同时,实现更优的下游性能与分布偏移鲁棒性。
- 证明性能提升可随训练数据规模增长而扩展,从而具备更广泛的应用潜力。
提出的方法
- 该方法采用学生-教师框架,其中学生模型逐步从自身演化参数生成的软对齐目标中学习。
- 在每个小批量中,随机选择部分图像与标题,并基于模型当前预测分配软对齐目标,从而实现对潜在错位样本对的动态再校准。
- 模型采用互换预测策略,通过确保学生不会在自蒸馏过程中强化自身错误,防止表征崩溃。
- 采用动态划分策略,逐步增加用于生成软对齐目标的样本比例,实现渐进式知识蒸馏。
- 使用这些软目标优化对比损失,使模型能够学习到更一致且更鲁棒的联合嵌入空间。
- 该方法计算高效,且与现有CLIP风格训练流程兼容,无需额外参数或计算开销。
实验结果
研究问题
- RQ1在存在噪声的多对多图像-文本数据集上,使用软对齐目标的自蒸馏能否提升跨模态表征学习的鲁棒性?
- RQ2与硬负样本挖掘或标准对比学习相比,建模负样本之间的语义相似性是否能带来更好的下游性能与鲁棒性?
- RQ3与CLIP相比,所提方法在训练数据规模增加时,性能如何变化?
- RQ4模型能否在不引发表征崩溃或错误强化的前提下,有效从自身预测中蒸馏知识?
- RQ5与CLIP或ImageNet预训练模型相比,该方法是否在自然分布偏移下展现出更优的有效鲁棒性?
主要发现
- 所提方法在14项基准数据集上的零样本分类、线性探测与图像-文本检索任务中均优于CLIP,且无额外计算成本。
- 在ImageNet-R鲁棒性基准测试中,该方法在自然分布偏移下的有效鲁棒性优于CLIP与ImageNet预训练模型。
- 在COCO预训练设置下,该方法实现23.51%的零样本ImageNet Top-1准确率,超过CLIP基线,检索任务的平均召回率在top-1(MS R1)达到28.48%。
- 消融研究证实,直接从模型自身后验分布进行自举会导致性能下降,而所提出的动态划分与互换预测策略可恢复并超越基线性能。
- 相较于CLIP,性能提升随训练数据规模增长而扩大,表明其在大规模数据集上具有强大的泛化潜力。
- 定性分析表明,该模型能捕捉更全面的语义匹配,检索出与文本查询多个方面相匹配的图像,而CLIP则更聚焦于单一属性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。