[论文解读] Adapting CLIP For Phrase Localization Without Further Training
该论文提出了一种零样本短语定位方法,通过在无需微调或人工标注边界框的情况下适配CLIP实现密集视觉定位。通过从CLIP的ViT和ResNet变体中提取高分辨率空间特征图,该方法计算文本查询与图像特征之间的逐像素相似度,生成定位热力图,在Flickr30k和Visual Genome数据集的零样本设置下实现了最先进性能,相比先前的无训练方法最高提升5个百分点的绝对准确率。
Supervised or weakly supervised methods for phrase localization (textual grounding) either rely on human annotations or some other supervised models, e.g., object detectors. Obtaining these annotations is labor-intensive and may be difficult to scale in practice. We propose to leverage recent advances in contrastive language-vision models, CLIP, pre-trained on image and caption pairs collected from the internet. In its original form, CLIP only outputs an image-level embedding without any spatial resolution. We adapt CLIP to generate high-resolution spatial feature maps. Importantly, we can extract feature maps from both ViT and ResNet CLIP model while maintaining the semantic properties of an image embedding. This provides a natural framework for phrase localization. Our method for phrase localization requires no human annotations or additional training. Extensive experiments show that our method outperforms existing no-training methods in zero-shot phrase localization, and in some cases, it even outperforms supervised methods. Code is available at https://github.com/pals-ttic/adapting-CLIP .
研究动机与目标
- 解决人工标注短语定位数据集的高成本与可扩展性限制问题。
- 消除对目标检测器或其他具有类别偏见的预训练模型的依赖。
- 仅使用预训练的CLIP模型,无需任何额外训练,实现零样本短语定位。
- 开发一种可泛化的通用方法,适用于开放词汇、罕见及未见物体类别。
提出的方法
- 通过修改模型前向传播过程,使CLIP在ViT和ResNet架构上均能生成高分辨率空间特征图,以保留空间信息。
- 使用CLIP文本编码器将输入短语嵌入与图像特征相同的语义空间。
- 计算文本嵌入与每个空间特征图之间的逐像素余弦相似度,生成得分热力图。
- 应用类似非极大值抑制的流程,从热力图中提取得分最高的边界框。
- 采用上采样技术提升特征图的空间分辨率,从而提高定位精度。
- 利用预训练CLIP模型的零样本泛化能力,无需在定位特定数据上进行微调。
实验结果
研究问题
- RQ1CLIP能否在无需额外训练或标注的情况下实现密集视觉定位?
- RQ2当模型从未见过定位标注时,CLIP的零样本能力在短语定位任务中有多高效?
- RQ3CLIP主干网络的选择(ViT与ResNet)以及特征分辨率是否影响定位性能?
- RQ4与依赖预训练检测器的方法相比,该方法在罕见或未见物体类别上的表现如何?
主要发现
- 在Flickr30k和Visual Genome的四个零样本划分中的三个上,该方法相比现有无训练方法最高提升5个百分点的绝对准确率。
- 在Flickr-All划分上,该方法达到43.80%的平均IoU,显著优于相同零样本设置下ZSGNet的38.31%。
- ViT-L/14模型在Flickr-S0上达到40.37% IoU,在Flickr-S1上达到36.10%,展现出对未见短语和类别的强大泛化能力。
- 更高分辨率的特征图(2倍上采样)在所有模型和数据集上均一致提升性能,部分划分上提升最高达2.5%。
- 与依赖预训练目标检测器的方法相比,该方法在长尾分布和罕见物体类别上的泛化能力更强,显著降低了类别偏见。
- 消融实验表明,更大的CLIP模型和更精细的空间分辨率可带来更好的定位效果,其中ViT-B/16和ViT-L/14优于基于ResNet的变体。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。