[论文解读] Improving Weakly Supervised Visual Grounding by Contrastive Knowledge Distillation
本文提出了一种对比知识蒸馏框架,用于弱监督视觉定位,该框架在训练过程中利用预训练的目标检测器来指导区域-短语匹配,而无需在推理时进行检测。通过联合优化从检测器预测蒸馏得到的区域-短语得分函数,以及通过对比学习得到的图像-句子得分函数,该方法在 Flickr30K Entities 上实现了 SOTA 性能(准确率提升 50.96%),在 ReferItGame 上也实现了 SOTA 性能(准确率提升 27.59%),优于需要在测试时使用目标检测器的方法。
Weakly supervised phrase grounding aims at learning region-phrase correspondences using only image-sentence pairs. A major challenge thus lies in the missing links between image regions and sentence phrases during training. To address this challenge, we leverage a generic object detector at training time, and propose a contrastive learning framework that accounts for both region-phrase and image-sentence matching. Our core innovation is the learning of a region-phrase score function, based on which an image-sentence score function is further constructed. Importantly, our region-phrase score function is learned by distilling from soft matching scores between the detected object names and candidate phrases within an image-sentence pair, while the image-sentence score function is supervised by ground-truth image-sentence pairs. The design of such score functions removes the need of object detection at test time, thereby significantly reducing the inference cost. Without bells and whistles, our approach achieves state-of-the-art results on visual phrase grounding, surpassing previous methods that require expensive object detectors at test time.
研究动机与目标
- 解决在缺乏真实边界框标注的情况下,学习弱监督视觉定位中区域-短语对应关系的挑战。
- 通过消除推理时对目标检测器的需求,降低推理成本,同时保持高定位准确率。
- 利用目标检测器提供的外部知识,提升共现视觉概念(如 'dog' 与 'dog head')的区分能力。
- 开发一种系统化、高效且有效的联合方法,结合对比学习与知识蒸馏用于视觉定位。
提出的方法
- 该方法通过蒸馏检测到的物体名称与图像-句子对中候选短语之间的软匹配得分,学习一个区域-短语得分函数。
- 提出一种基于噪声对比估计(NCE)损失的对比学习框架,通过图像-句子匹配的监督信号,基于相似性对齐区域-短语对。
- 图像-句子得分函数由真实图像-句子对进行监督,从而实现区域-短语匹配与图像-句子匹配的联合优化。
- 最终模型在推理时使用学习到的得分函数,从而无需在测试时使用目标检测器。
- 该方法采用两阶段学习过程:首先从目标检测器输出中蒸馏知识(如 Open Images 类别),然后与对比图像-句子损失联合优化。
- 模型使用主干网络(如 ResNet-101)和检测器(如 IRV2-OI)进行端到端训练,推理时使用得分函数预测每个短语对应最高得分区域。
实验结果
研究问题
- RQ1能否从目标检测器预测中进行知识蒸馏,以在不依赖推理时检测器的情况下,提升弱监督视觉定位中的区域-短语匹配性能?
- RQ2当与目标检测输出的蒸馏结合时,图像-句子对上的对比学习如何提升定位准确率?
- RQ3知识蒸馏与对比学习对弱监督定位性能提升的相对贡献分别是什么?
- RQ4通过蒸馏与对比学习联合训练的统一得分函数,能否超越需要在测试时使用目标检测器的方法?
- RQ5如何将目标检测器知识有效整合到弱监督视觉定位模型中?
主要发现
- 完整模型(NCE+Distill)在 Flickr30K Entities 上达到 50.96% 的准确率,显著超越先前的 SOTA 方法。
- 在 ReferItGame 上,该方法达到 27.59% 的准确率,显著优于以往方法,包括那些在测试时使用强检测器的方法。
- NCE 损失在 Flickr30K 上比最大间隔损失提升 +6.2%,在 ReferItGame 上提升 +3.7%,证明了对比学习的有效性。
- 当使用 ResNet-101 与 IRV2-OI 检测器时,知识蒸馏在 Flickr30K 上带来 +2.61% 的性能提升,在 ReferItGame 上带来 +0.96% 的提升,表明在不同主干网络上均具有一致增益。
- 消融实验表明,NCE 与蒸馏提供互补信号:蒸馏有助于区分共现概念(如 'person' 与 'face'),而 NCE 能捕捉细微属性(如 '条纹衬衫')。
- 该方法在不同主干网络与检测器上均具有泛化能力,即使视觉主干与检测器的知识对齐程度不同,仍能保持一致的性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。