[论文解读] Getting More Juice Out of Your Data: Hard Pair Refinement Enhances Visual-Language Models Without Extra Data
本文提出 Helip,一种即插即用的微调方法,通过利用从原始训练数据中挖掘的难负样本以及一种新颖的难负样本边缘损失(HNML),增强如 CLIP 和 SLIP 等预训练视觉-语言模型。无需额外数据或重新训练,Helip 在零样本 ImageNet 准确率上最高提升 10.14%,在线性探测准确率上最高提升 9.5%,在多个基准测试中均展现出一致的性能提升。
Contrastive Language-Image Pre-training (CLIP) has become the standard for cross-modal image-text representation learning. Improving CLIP typically requires additional data and retraining with new loss functions, but these demands raise resource and time costs, limiting practical use. In this work, we introduce HELIP, a cost-effective strategy that improves CLIP models by exploiting challenging text-image pairs within existing datasets in continuous training. This eliminates the need for additional data or extensive retraining. Moreover, HELIP integrates effortlessly into current training pipelines with minimal code modifications, allowing for quick and seamless implementation. On comprehensive benchmarks, HELIP consistently boosts existing models. In particular, within just two epochs of training, it improves zero-shot classification accuracy on ImageNet for SLIP models pre-trained on CC3M, CC12M, and YFCC15M datasets by 3.05%, 4.47%, and 10.1% , respectively. In addition, on fine-grained classification datasets, HELIP improves the zero-shot performance of CLIP and SLIP by an average of 8.4% and 18.6%, and their linear probe performance by an average of 9.5% and 3.0%. The code is publicly available at: https://github.com/haonan3/HELIP-NACCL-2025.git.
研究动机与目标
- 在不从头重新训练或收集新数据的前提下,提升预训练视觉-语言模型的零样本和检索性能。
- 解决因小批量大小和噪声较多的网络爬取数据导致的批次内难负样本挖掘效率低下问题。
- 开发一种低成本、可泛化的微调策略,仅使用原始训练数据即可提升模型性能。
- 验证难负样本和通过 HNML 实现的几何正则化可显著提升表示质量。
提出的方法
- Helip 通过将目标图像-文本对映射到完整数据集,利用模态特定表示(如视觉使用 ResNet50,文本使用 BERT)中相似度高的配对,执行难正负对挖掘(HPM)。
- 所选子集构成目标对的难负样本集,确保高质量、具有挑战性的负样本,语义上接近但并非正样本匹配。
- Helip 使用标准对比损失与新型难负样本边缘损失(HNML)联合微调预训练模型,强制模型在嵌入空间中使难负样本比普通负样本更接近正样本。
- HNML 通过惩罚模型在距离上对难负样本超过普通负样本的情况,引入几何结构,提升判别能力。
- 该方法采用近似 HPM 变体,从完整数据集中采样固定大小子集(如 3M 或 6M)以加速挖掘,同时保持性能。
- 该框架以即插即用方式部署,仅需在原始训练数据上进行微调,无需修改模型架构。
实验结果
研究问题
- RQ1能否从原始训练数据中挖掘的难负样本显著提升预训练视觉-语言模型的零样本性能,而无需额外数据?
- RQ2引入一种区分普通负样本与难负样本的边缘损失,是否能带来更好的表示学习?
- RQ3与批次内挖掘相比,两阶段方法(即在微调前全局预挖掘难对)的效率如何?
- RQ4所提方法能否在不同预训练模型(如 CLIP、SLIP、DECLIP)和数据集(如 CC3M、CC12M、YFCC15M)上实现泛化?
- RQ5近似 HPM 策略在保持性能的同时,是否能实现对更大数据集的可扩展性?
主要发现
- 对于在 CC3M 上预训练的 SLIP 模型,Helip 将零样本 ImageNet 准确率提升 3.05 个百分点;在 CC12M 上预训练的模型则提升 4.47 个百分点。
- 在 CC3M 上预训练时,Helip 使 CLIP 和 SLIP 在七个细粒度分类数据集上的平均零样本准确率分别提升 8.4% 和 18.6%。
- 在线性探测任务中,Helip 使在 CC3M 上预训练的 CLIP 和 SLIP 的平均准确率分别提升 9.5% 和 3.0%。
- 采用 600 万子集的近似 HPM 变体,其零样本性能与完整 HPM 方法相差不超过 0.6%,证明了其可扩展性与效率。
- HNML 损失在类别粒度较高的数据集(如 ImageNet、CIFAR-100)上表现更优,但在 CIFAR-10 上略有性能下降,表明存在判别能力的权衡。
- 可视化结果证实,近似 HPM 选择的样本在语义上接近目标样本,验证了所挖掘负样本的质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。