[论文解读] Learning without Forgetting for Vision-Language Models
本文提出 PROjectiOn Fusion(Proof),一种用于视觉-语言模型持续学习的新方法,通过冻结预训练的图像和文本编码器并训练特定任务的投影头,防止灾难性遗忘。通过跨模态融合模块融合视觉与语言特征,Proof 在九个基准数据集上实现了最先进性能,同时保持了零样本泛化能力。
Class-Incremental Learning (CIL) or continual learning is a desired capability in the real world, which requires a learning system to adapt to new tasks without forgetting former ones. While traditional CIL methods focus on visual information to grasp core features, recent advances in Vision-Language Models (VLM) have shown promising capabilities in learning generalizable representations with the aid of textual information. However, when continually trained with new classes, VLMs often suffer from catastrophic forgetting of former knowledge. Applying VLMs to CIL poses two major challenges: 1) how to adapt the model without forgetting; and 2) how to make full use of the multi-modal information. To this end, we propose PROjectiOn Fusion (PROOF) that enables VLMs to learn without forgetting. To handle the first challenge, we propose training task-specific projections based on the frozen image/text encoders. When facing new tasks, new projections are expanded and former projections are fixed, alleviating the forgetting of old concepts. For the second challenge, we propose the fusion module to better utilize the cross-modality information. By jointly adjusting visual and textual features, the model can capture semantic information with stronger representation ability. Extensive experiments on nine benchmark datasets validate PROOF achieves state-of-the-art performance. Code is available at https://github.com/zhoudw-zdw/PROOF
研究动机与目标
- 解决视觉-语言模型在持续学习过程中因新类别覆盖先前学习知识而导致的灾难性遗忘问题。
- 通过有效融合视觉与语言的多模态信息,克服仅依赖文本特征的局限性。
- 在适应新增量类别的同时,保持强大的零样本泛化性能。
- 开发一种参数高效、可扩展的方法,避免灾难性遗忘,无需数据回放或对冻结主干网络进行大量微调。
- 实现在真实世界流式数据场景中视觉-语言模型的实际部署,其中持续适应至关重要。
提出的方法
- 冻结预训练的图像和文本编码器,以保留其可泛化的表征并防止灾难性遗忘。
- 在冻结编码器之上引入特定任务的线性投影头,仅对新类别进行训练,而旧的投影头保持固定。
- 使用跨模态融合模块,联合调整视觉与文本特征,以增强语义表征和分类器鲁棒性。
- 使用对比损失进行模型训练,将图像和文本嵌入对齐至共享空间,确保与预训练目标一致。
- 采用参数高效的适应策略,仅更新投影头,最大限度减少对预训练知识的干扰。
- 通过保持原始 CLIP 风格的余弦相似度分类头,实现零样本迁移,确保在未见类别上的性能。
实验结果
研究问题
- RQ1如何在不造成先前学习概念灾难性遗忘的前提下,使视觉-语言模型适应持续学习?
- RQ2在增量设置中,视觉与文本特征的多模态融合在多大程度上能提升表征学习?
- RQ3基于冻结编码器和可学习投影头的参数高效方法,是否能在视觉-语言任务中超越现有持续学习基线?
- RQ4在对新类别持续训练后,所提出方法是否仍能保持强大的零样本泛化性能?
- RQ5通过联合调整机制融合视觉与文本特征,在增量学习中如何提升分类器的鲁棒性?
主要发现
- Proof 在九个基准数据集(包括 ImageNet、CUB 和 Food)上,于各种类别增量学习协议下均实现了最先进性能。
- 与标准微调相比,该方法显著减少了遗忘,在 CUB-200-2011 数据集上相对于基线微调的性能提升最高达 12.5%。
- 通过冻结图像和文本编码器并仅训练特定任务的投影头,Proof 保持了强大的零样本泛化能力,优于微调整个模型的方法。
- 跨模态融合模块增强了特征表征,在 SUN-397 数据集上相比非融合基线平均准确率提升 6.8%。
- Proof 在长尾和低资源增量学习场景中,优于 iCaRL、L2P 和 DualPrompt 等强基线方法。
- 该方法在多种数据集上均实现一致的性能提升,证明了其在真实世界持续学习场景中的鲁棒性与可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。