Skip to main content
QUICK REVIEW

[논문 리뷰] Vision-Language Pre-Training with Triple Contrastive Learning

Jinyu Yang, Jiali Duan|arXiv (Cornell University)|2022. 02. 21.
Multimodal Machine Learning Applications인용 수 14
한 줄 요약

이 논문은 시각-언어 사전학습 프레임워크인 트리플 콘트라스티브 러닝(TCL)을 제안한다. 이는 교차 모달 일치(CMA), 내모달 콘트라스티브 러닝(IMC), 국소 상호정보 최대화(LMI)를 결합하여 표현 학습을 향상시킨다. 서로 다른 모달 간 및 국소 영역 내에서 자기지도 학습을 활용함으로써, TCL은 이미지-텍스트 검색 및 시각질의 응답(VQA) 작업에서 최신 기준(SOTA) 성능을 달성하며, MSCOCO와 Flickr30K 벤치마크에서 이전 방법들을 능가한다.

ABSTRACT

Vision-language representation learning largely benefits from image-text alignment through contrastive losses (e.g., InfoNCE loss). The success of this alignment strategy is attributed to its capability in maximizing the mutual information (MI) between an image and its matched text. However, simply performing cross-modal alignment (CMA) ignores data potential within each modality, which may result in degraded representations. For instance, although CMA-based models are able to map image-text pairs close together in the embedding space, they fail to ensure that similar inputs from the same modality stay close by. This problem can get even worse when the pre-training data is noisy. In this paper, we propose triple contrastive learning (TCL) for vision-language pre-training by leveraging both cross-modal and intra-modal self-supervision. Besides CMA, TCL introduces an intra-modal contrastive objective to provide complementary benefits in representation learning. To take advantage of localized and structural information from image and text input, TCL further maximizes the average MI between local regions of image/text and their global summary. To the best of our knowledge, ours is the first work that takes into account local structure information for multi-modality representation learning. Experimental evaluations show that our approach is competitive and achieves the new state of the art on various common down-stream vision-language tasks such as image-text retrieval and visual question answering.

연구 동기 및 목표

  • 기존의 시각-언어 사전학습 방법이 교차 모달 일치에만 집중하여 내모달 구조와 국소 특징 표현을 忽시하는 한계를 해결한다.
  • 유사한 시각 또는 텍스트의 다양한 시각화가 임베딩 공간에서 가까이 유지되도록 내모달 콘트라스티브 러닝(IMC)을 도입하여 표현 품질을 향상시킨다.
  • 전역 표현과 국소 이미지 패치 또는 텍스트 토큰 간의 상호정보를 최대화하여 표현의 표현력과 구조적 세부 정보를 향상시킨다.
  • 웹에서 수집된 노이즈가 많은 데이터셋으로 인한 성능 저하를 줄이기 위해 각 모달 내부 및 국소 영역 간 자기지도 학습을 강화한다.
  • 교차 모달, 내모달, 국소 구조 감독을 통합하여 최종적인 다중 모달 표현을 개선함으로써, 후속 작업에 더 나은 공동 표현을 얻는다.

제안 방법

  • 교차 모달 일치(CMA), 내모달 콘트라스티브 러닝(IMC), 국소 상호정보 최대화(LMI)를 결합한 삼중 콘트라스티브 러닝(TCL) 프레임워크를 제안한다.
  • CMA는 InfoNCE 손실을 사용하여 매칭된 이미지-텍스트 쌍 간의 상호정보를 최대화함으로써 임베딩을 서로 가까이 끌어당긴다.
  • 동일한 이미지(또는 텍스트)에 대해 두 개의 증강된 시각화를 생성하고, 그들의 상호정보를 최대화함으로써 내모달 강건성을 향상시킨다.
  • 전역 [CLS] 표현과 각 국소 패치(이미지) 또는 토큰(텍스트) 간의 상호정보를 최대화하기 위해 LMI를 도입하여 공간적 및 구조적 맥락을 유지한다.
  • 시각 및 텍스트 트랜스포머의 마지막 레이어 패치 임베딩을 국소 특징으로 사용하며, 전역 평균 풀링을 통해 차원을 감소시키면서도 공간 관계를 유지한다.
  • CMA, IMC, LMI 손실의 조합을 사용하여 모델을 엔드 투 엔드로 훈련시키며, 긍정 키 생성을 위한 모멘타ム 업데이트 메커니즘을 적용한다.

실험 결과

연구 질문

  • RQ1내모달 콘트라스티브 러닝이 교차 모달 일치 외에도 시각-언어 표현 품질을 향상시킬 수 있는가?
  • RQ2전역 표현과 국소 이미지/텍스트 특징 간의 국소 상호정보 최대화를 통합하면 후속 작업 성능이 향상되는가?
  • RQ3교차 모달, 내모달, 국소 구조 감독의 통합이 노이즈가 많은 웹 스케일 데이터셋에서 표현 학습에 어떤 영향을 미치는가?
  • RQ4데이터 크기와 증강 전략이 제안된 TCL 프레임워크의 효과성에 어떤 영향을 미치는가?
  • RQ5국소 특징으로서 마지막 레이어 패치 임베딩을 사용할 경우, 중간 레이어 특징보다 성능이 뛰어나거나 유사한가?

주요 결과

  • TCL은 이미지-텍스트 검색에서 새로운 SOTA 성능을 달성하였으며, MSCOCO에서 94.8% R@1, Flickr30K에서 82.8%를 기록하여 이전 SOTA 방법을 능가한다.
  • 제거 실험을 통해 강력한 증강을 사용한 IMC 추가로 기준 모델 대비 최대 1.4% R@1 향상됨을 확인하여 내모달 학습에서의 효과를 입증한다.
  • LMI 도입으로 성능이 추가로 향상되어, MSCOCO에서 94.9% R@1, Flickr30K에서 84.0%를 달성함으로써 국소 구조 인식이 표현 품질 향상에 기여함을 보여준다.
  • LMI에 마지막 레이어 패치 임베딩을 사용할 경우 중간 레이어 특징보다 유사하거나 더 좋은 성능을 기록함으로써, 최종 레이어 표현이 국소 상호정보 최대화에 더 적합함을 시사한다.
  • 더 큰 데이터셋(14M 대비 4M)에서 사전학습을 수행할 경우 성능 향상이 뚜렷하게 나타나며, R@1이 벤치마크 전반에서 2.9–3.4% 상승함을 확인하여 TCL의 확장성 잠재력을 입증한다.
  • 모멘타ム 계수 $ m = 0.5 $ 가 최적의 성능을 낳으며, MoCo에서 일반적으로 사용되는 값과 다름을 확인하여 TCL의 모멘타ム 메커니즘은 고유한 역학을 가짐을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.