Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring Visual Interpretability for Contrastive Language-Image Pre-training

Yi Li, Hualiang Wang|arXiv (Cornell University)|2022. 09. 15.
Multimodal Machine Learning Applications인용 수 11
한 줄 요약

이 논문은 대조적 언어-이미지 사전학습(Contrastive Language-Image Pre-training, CLIP)의 시각적 해석 가능성(visual interpretability)을 향상시키기 위해 ECLIP를 제안한다. ECLIP는 풀링 레이어에서 발생하는 의미 이탈(semantic shift)으로 인해 CLIP가 배경 영역을 전경보다 우선시한다는 점을 규명한다. 학습 중에 자기지도 학습된 attention 맵을 기반으로 한 마스크된 최대 풀링(masks max pooling)으로 주의 풀링을 대체함으로써, 인식 정확도를 유지하면서도 시각적 해석 편향을 수정한다. 이로써 세 가지 벤치마크에서 최신 기준 수준의 설명 가능성(explainability)을 달성한다.

ABSTRACT

Contrastive Language-Image Pre-training (CLIP) learns rich representations via readily available supervision of natural language. It improves the performance of downstream vision tasks, including but not limited to the zero-shot, long tail, segmentation, retrieval, caption, and video. However, the visual explainability of CLIP is rarely studied, especially for the raw feature map. To provide visual explanations of its predictions, we propose the Image-Text Similarity Map (ITSM). Based on it, we surprisingly find that CLIP prefers the background regions than the foregrounds, and shows erroneous visualization results against human understanding. This phenomenon is universal for both vision transformers and convolutional networks, which suggests this problem is unique and not owing to certain network. Experimentally, we find the devil is in the pooling part, where inappropriate pooling methods lead to a phenomenon called semantic shift. For this problem, we propose the Explainable Contrastive Language-Image Pre-training (ECLIP), which corrects the explainability via the Masked Max Pooling. Specifically, to avoid the semantic shift, we replace the original attention pooling by max pooling to focus on the confident foreground, with guidance from free attention during training. Experiments on three datasets suggest that ECLIP greatly improves the explainability of CLIP, and beyond previous explainability methods at large margins. The code will be released later.

연구 동기 및 목표

  • CLIP의 시각적 설명이 인간의 인지와 정반대되는 이유를 조사하며, 특히 전경보다 배경 영역을 우선시하는 경향을 밝히는 것.
  • 이 비직관적인 행동의 근본 원인을 풀링 메커니즘, 특히 평균 유사 풀링 연산의 역할에서 규명하는 것.
  • 원래의 인식 성능를 유지하면서 CLIP 예측의 시각적 설명 가능성을 향상시키는 방법을 개발하는 것.
  • 자유로운 attention 맵을 사용하여 학습 시점에 특징 선택을 분류에 유용한 전경 영역으로 유도하는 해결책을 제안하는 것.

제안 방법

  • 텍스트 특징와 이미지 토큰 특징 간의 유사도를 계산하여 원시 CLIP 예측을 시각화하기 위해 이미지-텍스트 유사도 맵(Image-Text Similarity Map, ITSM)을 도입한다.
  • 의미 이탈을 줄이고 확신 있는 전경 영역에 집중하기 위해 원래의 주의 풀링을 최대 풀링으로 대체한다.
  • 추론 과정에 영향을 주지 않도록, 학습 중에 MoCoV3 또는 DINO에서 유도된 자기지도 학습된 attention 맵을 마스크로 사용하여 최대 풀링 동작을 유도한다.
  • 해석 가능성과 분류를 분리하기 위해 새로운 가중치 학습 가능한 선형 투영을 도입하며, CLIP의 원래 성능를 유지한다.
  • CLIP 백본은 고정하고, 새로운 선형 레이어와 마스크된 최대 풀링만 미세조정하여 정확도 저하 없이 모델을 훈련한다.
  • 두 가지 변형을 제안한다: RCLIP(역전 CLIP, 학습 없음)와 ECLIP(마스크된 최대 풀링 포함), 둘 다 향상된 설명 가능성을 달성한다.

실험 결과

연구 질문

  • RQ1왜 CLIP는 인간의 이해와 정면으로 배치되는 시각적 설명을 내보내며, 배경 영역을 전경보다 우선시하는가?
  • RQ2CLIP의 배경 편향은 아키텍처 설계의 결과인가, 아니면 네트워크 내부의 특정 모듈 탓인가?
  • RQ3모델 전체를 재학습하거나 인간이 레이블링한 마스크를 사용하지 않고도 평균 유사 풀링이 유도하는 의미 이탈을 수정할 수 있는가?
  • RQ4학습 중에 자기지도 학습된 attention 맵을 사용하면 텍스트와 분류에 중요한 이미지 영역 간의 정렬이 향상되는가?
  • RQ5기존의 기울기 기반 또는 attention 기반 방법보다 단순한, backpropagation 기반의 방법이 더 뛰어난 설명 가능성을 달성할 수 있는가?

주요 결과

  • 이미지-텍스트 유사도 맵을 통해, ResNet 또는 비전 트랜스포머 백본을 사용하든 간에 CLIP는 항상 배경 영역을 전경보다 우선시하는 것으로 나타났다.
  • 이러한 행동의 근본 원인은 풀링 레이어에서 발생하는 의미 이탈이며, 특히 주의 풀링과 글로벌 평균 풀링과 같은 평균 유사 연산 때문임을 규명했다.
  • 주의 풀링을 최대 풀링으로 대체함으로써 배경 편향을 줄이고 설명 가능성을 향상시켰으며, mIoU는 17.55% 향상되고 mSC는 30.53% 향상되었다.
  • 학습 중에 자기지도 학습된 attention 맵을 마스크로 도입함으로써 성능을 추가로 향상시켰으며, DINO 가이드를 사용할 경우 mIoU는 45.52로, mSC는 26.16로 상승했다.
  • ECLIP는 원래 CLIP와 동일한 인식 정확도를 유지한다(예: ImageNet-S50에서 90.54 mAP), 동시에 설명 가능성을 크게 향상시켰다.
  • qualitative 및 quantitative 평가에서 기존의 Grad-CAM 및 최신 ViT 기반 방법 [9]을 모두 능가하며, 관련 이미지 영역의 국소화 성능이 뛰어나다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.