[论文解读] Delving into Multimodal Prompting for Fine-grained Visual Classification
本文提出MP-FGVC,一种新颖的多模态提示框架,通过利用CLIP模型并结合子类别特定的视觉提示与差异感知文本提示,提升细粒度视觉分类性能,在四个FGVC基准上实现最先进性能,且微调成本极低。
Fine-grained visual classification (FGVC) involves categorizing fine subdivisions within a broader category, which poses challenges due to subtle inter-class discrepancies and large intra-class variations. However, prevailing approaches primarily focus on uni-modal visual concepts. Recent advancements in pre-trained vision-language models have demonstrated remarkable performance in various high-level vision tasks, yet the applicability of such models to FGVC tasks remains uncertain. In this paper, we aim to fully exploit the capabilities of cross-modal description to tackle FGVC tasks and propose a novel multimodal prompting solution, denoted as MP-FGVC, based on the contrastive language-image pertaining (CLIP) model. Our MP-FGVC comprises a multimodal prompts scheme and a multimodal adaptation scheme. The former includes Subcategory-specific Vision Prompt (SsVP) and Discrepancy-aware Text Prompt (DaTP), which explicitly highlights the subcategory-specific discrepancies from the perspectives of both vision and language. The latter aligns the vision and text prompting elements in a common semantic space, facilitating cross-modal collaborative reasoning through a Vision-Language Fusion Module (VLFM) for further improvement on FGVC. Moreover, we tailor a two-stage optimization strategy for MP-FGVC to fully leverage the pre-trained CLIP model and expedite efficient adaptation for FGVC. Extensive experiments conducted on four FGVC datasets demonstrate the effectiveness of our MP-FGVC.
研究动机与目标
- 解决细粒度视觉分类(FGVC)中的挑战,即类别间差异细微且类内差异大,导致难以准确识别。
- 探索预训练视觉-语言模型(如CLIP)在FGVC中的潜力,尽管其当前重点在于高层级类别语义,而非子类别特定细节。
- 开发一种多模态提示方法,通过视觉与语言模态显式突出子类别特定的差异。
- 通过视觉-语言融合模块(VLFM)在统一语义空间中实现视觉与语言提示的有效跨模态协作。
- 采用两阶段训练策略优化微调过程,以在微调FGVC的同时保留CLIP的预训练能力。
提出的方法
- 引入子类别特定视觉提示(SsVP),通过重要性排序机制选择最显著的图像块(k=14),以强调子类别特定的视觉特征。
- 提出差异感知文本提示(DaTP),一种可学习的文本模板(J=16个标记),通过从超类别名称微调生成子类别特定的描述。
- 设计视觉-语言融合模块(VLFM),在共享语义空间中对齐并融合视觉与文本提示,以支持跨模态推理。
- 实施两阶段训练策略:第一阶段冻结CLIP的图像与文本编码器,仅训练SsVP与DaTP;第二阶段端到端微调整个模型。
- 使用对比学习目标对齐图像与文本表示,确保模型学习到子类别的判别性特征。
- 应用GradCAM可视化分析注意力图,验证MP-FGVC增强了对子类别判别区域(如头部、翅膀、尾部颜色)的关注。
实验结果
研究问题
- RQ1能否通过利用子类别特定的视觉与文本线索,有效适配预训练视觉-语言模型(如CLIP)用于细粒度视觉分类?
- RQ2如何协同设计视觉与语言提示,以突出细粒度类别中细微的类别间差异?
- RQ3提示中视觉与文本标记的最优数量是多少,才能在不过拟合或引入噪声的前提下最大化性能?
- RQ4两阶段训练策略是否优于端到端训练,从而在保留CLIP预训练知识的同时实现有效的微调?
- RQ5所提出的多模态提示框架是否能在多种FGVC数据集上实现一致的性能提升,且仅需极少的架构修改?
主要发现
- MP-FGVC在四个标准FGVC基准(CUB-200-2011、NABirds、Stanford Cars、FG-Wild)上达到最先进性能,显著优于基线方法。
- 消融实验确认SsVP与DaTP均至关重要:移除任一组件均导致性能显著下降,验证了其互补作用。
- 最优超参数为k=14(视觉标记数)与J=16(文本标记数);当数值超过14与32时,性能下降,表明表达能力与噪声之间存在权衡。
- 两阶段训练策略显著优于单阶段训练,因早期阶段文本提示的随机初始化会阻碍优化,导致次优收敛。
- 可视化结果表明,MP-FGVC增强了对子类别判别区域(如头部、背部、腹部、翅膀)的关注,证实了特征定位能力的提升。
- 该方法对提示模板变化具有鲁棒性,无论使用“a photo of a”前缀或子类别名称后缀,性能均仅出现轻微下降,表明其具备良好的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。