Skip to main content
QUICK REVIEW

[论文解读] CLIP4IDC: CLIP for Image Difference Captioning

Zixin Guo, Tzu-Jui Julius Wang|arXiv (Cornell University)|Jun 1, 2022
Multimodal Machine Learning Applications被引用 4
一句话总结

CLIP4IDC 提出了一种两阶段的适配与微调策略,以将 CLIP 适配于图像差异描述(IDC)任务,在微调前通过对比检索损失提升图像对差异的视觉表征。该方法通过缩小 CLIP 预训练与 IDC 微调之间的领域和目标差距,在三个 IDC 基准上实现了最先进性能。

ABSTRACT

Image Difference Captioning (IDC) aims at generating sentences to describe differences between two similar-looking images. Conventional approaches learn an IDC model with a pre-trained and usually frozen visual feature extractor. Accordingly, two major issues may arise: (1) a large domain gap usually exists between the pre-training datasets used for training such a visual encoder and that of the downstream IDC task, and (2) the visual feature extractor, when separately encoding two images, often does not effectively encode the visual changes between two images. Due to the excellent zero-shot performance of the recently proposed CLIP, we thus propose CLIP4IDC to transfer a CLIP model for the IDC task to address those issues. Different from directly fine-tuning CLIP to generate sentences, we introduce an adaptation training process to adapt CLIP's visual encoder to capture and align differences in image pairs based on the textual descriptions. Experiments on three IDC benchmark datasets, CLEVR-Change, Spot-the-Diff, and Image-Editing-Request, demonstrate the effectiveness of CLIP4IDC.

研究动机与目标

  • 解决 CLIP 预训练与下游 IDC 任务之间的领域差距,因为预训练的视觉编码器往往难以捕捉细微差异。
  • 克服冻结视觉特征提取器无法有效建模图像间变化的局限。
  • 提升图像对视觉表征与差异文本描述之间的对齐程度。
  • 开发一种方法,在利用 CLIP 零样本能力的同时,通过针对性适配使其专门适用于 IDC 任务。
  • 证明基于检索的适配能有效提升在多样化 IDC 数据集上的下游描述性能。

提出的方法

  • 提出两阶段训练流程:(1) 使用对比检索损失进行适配,以对齐图像对表征与差异的文本描述;(2) 在适配后的视觉编码器上微调描述头。
  • 引入两个模块:一个跨图像对内的编码器(intra-encoder)用于提取并比较图像对内的差异,一个跨图像对的编码器(inter-encoder)用于将图像对与对应文本描述对齐。
  • 采用对比学习目标,其中正样本对(图像对 ↔ 描述)被拉近,负样本对被推远。
  • 在适配阶段使用图像对到文本和文本到图像对的检索任务进行训练,以确保对细微差异的建模。
  • 使用从原始图像像素端到端训练的 Transformer 描述头,对适配后的 CLIP 视觉编码器进行微调。
  • 在适配阶段进行端到端优化,随后联合微调视觉编码器与描述头。

实验结果

研究问题

  • RQ1能否通过基于检索的适配阶段有效适配 CLIP 用于图像差异描述任务,以捕捉细微的视觉变化?
  • RQ2所提出的适配与微调策略是否比直接微调或基于特征的微调更有效地缩小 CLIP 预训练与 IDC 任务之间的目标与领域差距?
  • RQ3在内部模块与外部模块中分配更多层数如何影响检索与描述性能?
  • RQ4在图像对到文本与文本到图像对检索任务上的检索性能,与下游描述准确率的相关性有多大?
  • RQ5CLIP4IDC 是否能在合成数据与真实世界 IDC 数据集之间实现泛化,包括混合真实-合成基准?

主要发现

  • CLIP4IDC 在所有三个 IDC 基准上均达到最先进性能:CLEVR-Change、Spot-the-Diff 和 Image-Editing-Request。
  • 在 CLEVR-Change 上,CLIP4IDC 在图像对到文本检索中达到 46.4% 的 R@1 和 86.6% 的 R@10,表明视觉差异与描述之间具有强对齐性。
  • 在 CLEVR-Change 测试集上,模型取得 37.4 的 BERTScore、146.5 的 ROUGE-L 和 75.2 的 CIDEr,优于强基线模型。
  • 适配阶段的检索性能与描述性能高度相关,验证了将检索指标用作 IDC 质量代理的有效性。
  • 为内部编码器模块分配更多层可提升性能,而移除外部编码器层则显著降低结果,证明其对建模图像间差异的必要性。
  • 消融实验表明,移除外部编码器层后,R@1 降至 2.3%,MdR 升至 182.0,确认全局图像间对齐对成功至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。