Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Visual Representation from Modality-Shared Contrastive Language-Image Pre-training

Haoxuan You, Luowei Zhou|arXiv (Cornell University)|2022. 07. 26.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 대비 학습 중 시각 및 언어 인코더 간 대부분의 파arameter를 공유하는 통합형 트랜스포머 기반 아키텍처인 모달리티 공유 대비 언어-이미지 사전학습(MS-CLIP)을 제안한다. 자기주의 및 피드포워드 가중치를 모달리티 간에 공유하면서 경량의 모달리티 특화 모듈을 사용함으로써, MS-CLIP는 파라미터 수가 적은 대신 기존 CLIP 대비 13% 상대적인 성능 향상을 이룩했으며, 이는 서로 다른 모달리티 간의 의미적 구조가 더 잘 정렬됨을 의미한다.

ABSTRACT

Large-scale multi-modal contrastive pre-training has demonstrated great utility to learn transferable features for a range of downstream tasks by mapping multiple modalities into a shared embedding space. Typically, this has employed separate encoders for each modality. However, recent work suggests that transformers can support learning across multiple modalities and allow knowledge sharing. Inspired by this, we investigate a variety of Modality-Shared Contrastive Language-Image Pre-training (MS-CLIP) frameworks. More specifically, we question how many parameters of a transformer model can be shared across modalities during contrastive pre-training, and rigorously examine architectural design choices that position the proportion of parameters shared along a spectrum. In studied conditions, we observe that a mostly unified encoder for vision and language signals outperforms all other variations that separate more parameters. Additionally, we find that light-weight modality-specific parallel modules further improve performance. Experimental results show that the proposed MS-CLIP approach outperforms vanilla CLIP by up to 13\% relative in zero-shot ImageNet classification (pre-trained on YFCC-100M), while simultaneously supporting a reduction of parameters. In addition, our approach outperforms vanilla CLIP by 1.6 points in linear probing on a collection of 24 downstream vision tasks. Furthermore, we discover that sharing parameters leads to semantic concepts from different modalities being encoded more closely in the embedding space, facilitating the transferring of common semantic structure (e.g., attention patterns) from language to vision. Code is available at \href{https://github.com/Hxyou/MSCLIP}{URL}.

연구 동기 및 목표

  • 대비 학습 중 시각 및 언어 인코더 간 트랜스포머 파라미터 공유의 가능성과 성능 영향을 조사하는 것.
  • 최적의 성능을 위해 공유하거나 모달리티 특화로 유지해야 할 구성 요소(예: 어텐션, 정규화, 임bedding)를 규명하는 것.
  • 경량의 모달리티 특화 모듈이 교차 모달 일반화와 모달리티 특화 전문화 사이의 균형을 유지함으로써 성능 향상에 기여할 수 있는지 평가하는 것.
  • 파라미터 공유가 시각 및 언어 모달리티 간 의미적 구조(예: 어텐션 패턴)를 얼마나 잘 정렬시키는지 분석하는 것.

제안 방법

  • 대부분의 트랜스포머 구성 요소—자기주의 및 피드포워드 네트워크—를 시각 및 언어 인코더 간에 공유하는 모달리티 공유 대비 학습 프레임워크(MS-CLIP)를 제안한다.
  • 입력 임베딩, 레이어 정규화, 출력 투영은 모달리티 특화여야 하며, 모든 트랜스포머 레이어는 공유할 수 있음을 규명한다.
  • 보조 설계 두 가지를 도입한다: 초기 특화(첫 번째 트랜스포머 블록을 모달리티 특화 CNN과 트랜스포머 레이어로 대체) 및 효율적 병렬 브랜치(깊이 분리 컨볼루션 어댑터를 통한 경량 다중 해상도 CNN을 시각 모듈에 추가).
  • 대규모 이미지-캡션 데이터셋(YFCC-100M 및 Laion-400M)에서 대비 손실을 사용하여 통합 모델을 사전학습한다.
  • 시각적 및 텍스처적 개념 간 어텐션 패턴 유사도를 기반으로 한 공통 의미 구조(CSC) 거리 메트릭을 사용해 교차 모달 의미 정렬을 측정한다.
  • 공유된 어텐션 헤드를 시각화하여, 이미지에서 'cat'과 텍스트에서 'cats'를 동시에 주목하는 등 모달리티 간 공통 참조 학습을 확인한다.

실험 결과

연구 질문

  • RQ1각 트랜스포머 레이어 내부에서 성능을 극대화하기 위해 어떤 서브모듈을 시각 및 언어 인코더 간에 공유해야 하는가?
  • RQ2대비 학습 설정에서 시각 및 언어 인코더 간의 레이어 공유 정도는 어느 정도가 최적인가?
  • RQ3경량의 모달리티 특화 구성 요소가 파라미터 공유를 해치지 않으면서도 모달리티 특화 특성을 수용함으로써 성능 향상에 기여할 수 있는가?
  • RQ4파라미터 공유가 시각 및 언어 모달리티 간 의미적 구조(예: 어텐션 패턴)를 얼마나 잘 정렬시키는가?

주요 결과

  • MS-CLIP는 파라미터 수가 적음에도 불구하고 YFCC-100M에서 사전학습한 결과, 기존 CLIP 대비 0-샷 ImageNet 분류 정확도에서 13% 상대적 향상을 기록한다.
  • 24개의 후행 시각 작업에서 선형 프로빙 정확도가 기존 CLIP 대비 1.6점 향상된다.
  • 자기주의 및 피드포워드 가중치를 포함한 모든 트랜스포머 레이어를 공유하는 것이 선택적 레이어 공유나 NAS 기반 전략보다 더 우수한 성능을 낸다.
  • 제안된 초기 특화 및 보조 병렬 브랜치 모듈은 조기 모달리티 특화 추상화와 향상된 공간 모델링을 가능하게 하여 성능을 추가로 향상시킨다.
  • 공통 의미 구조(CSC) 거리가 MS-CLIP에서 유의미하게 감소하여, 공유된 파라미터가 모달리티 간 유사한 어텐션 패턴을 유도함을 시사한다.
  • 시각화 결과 공유된 어텐션 헤드가 'cat'을 이미지에서, 'cats'를 텍스트에서 동시에 주목하는 등 공통 참조 관계를 학습함을 확인하여 교차 모달 정렬이 이루어짐을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.