Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-modal Alignment using Representation Codebook

Jiali Duan, Li‐Qun Chen|arXiv (Cornell University)|2022. 02. 28.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

이 논문은 공유된 학습 가능한 코드북을 사용하여 이미지 및 텍스트 특징을 더 높은 수준의 안정된 클러스터 수준 표현으로 정렬함으로써 시각-언어 표현 학습을 위한 새로운 방법, Codebook Learning with Distillation (CODIS)을 제안한다. 클러스터 할당을 대비하고 모멘텀 디스틸레이션을 활용하여 훈련을 안정화시킴으로써, CODIS는 대규모 데이터셋인 CLIP나 ALIGN에 의존하지 않고도 제로샷 이미지-텍스트 검색에서 새로운 SoTA 성능을 달성한다. 동시에 후행 전이 작업에서도 경쟁력을 유지한다.

ABSTRACT

Aligning signals from different modalities is an important step in vision-language representation learning as it affects the performance of later stages such as cross-modality fusion. Since image and text typically reside in different regions of the feature space, directly aligning them at instance level is challenging especially when features are still evolving during training. In this paper, we propose to align at a higher and more stable level using cluster representation. Specifically, we treat image and text as two "views" of the same entity, and encode them into a joint vision-language coding space spanned by a dictionary of cluster centers (codebook). We contrast positive and negative samples via their cluster assignments while simultaneously optimizing the cluster centers. To further smooth out the learning process, we adopt a teacher-student distillation paradigm, where the momentum teacher of one view guides the student learning of the other. We evaluated our approach on common vision language benchmarks and obtain new SoTA on zero-shot cross modality retrieval while being competitive on various other transfer tasks.

연구 동기 및 목표

  • 훈련 중 서로 다른 특징 공간 영역에 위치한 시각 및 언어 특징 간의 정렬 문제를 해결한다.
  • 개별 특징이 아닌 더 높은 수준의 표현인 클러스터 할당을 통해 교차 모odal 정렬을 향상시킨다.
  • 코드북 학습과 특징 정렬을 안내하는 새로운 디스틸레이션 메커니즘을 통해 훈련을 안정화시킨다.
  • CLIP나 ALIGN과 같은 대규모 데이터셋에 의존하지 않고도 제로샷 교차 모달 검색에서 최신 기술 수준(SoTA) 성능을 달성한다.
  • 코드북 기반의 대비 학습을 통해 단일 모odal 표현 학습 기법을 다중 모달 표현 학습으로 확장한다.

제안 방법

  • 시각-언어 특징 공간을 통합적으로 표현하는 공유된 학습 가능한 코드북(클러스터 중심의 사전)을 도입한다.
  • 이미지 및 텍스트 특징의 클러스터 할당을 비교하여 대비 학습을 수행함으로써, 코드북과 특징 인코더를 동시에 최적화한다.
  • 교수-학습 기반의 모멘텀 디스틸레이션 프레임워크를 사용하며, 이는 이동 평균 방식으로 업데이트되는 교수 인코더가 학생의 특징 및 코드북 할당 학습을 안내한다.
  • 최적 운반 이론 기반의 목적함수를 통해 코드북 업데이트를 최적화하여, 모odal 특징과 그에 할당된 코드워드 간의 거리를 최소화한다.
  • 디스틸레이션 메커니즘을 특징 학습뿐만 아니라 코드북 학습의 안정성 향상에도 적용하여 훈련의 불안정성을 감소시킨다.
  • 마스크된 언어 모델링(MLM), 이미지-텍스트 매칭(ITM), 코드북 감시가 포함된 혼합 목적함수를 사용하여 모델을 훈련한다.

실험 결과

연구 질문

  • RQ1개별 인스턴스 수준의 대비 학습에 비해 클러스터 수준의 표현 학습이 시각-언어 정렬의 안정성과 성능 향상에 기여하는가?
  • RQ2모멘텀 디스틸레이션 메커니즘을 도입함으로써 다중 모달 환경에서 코드북 학습과 교차 모달 정렬이 어떻게 향상되는가?
  • RQ3대규모 스케일 데이터셋에 의존하지 않고도 코드북 기반 접근이 제로샷 검색에서 SoTA 성능을 달성할 수 있는 정도는 어느 정도인가?
  • RQ4내모달 및 교차 모달 대비 신호를 동시에 학습함으로써 통합된 시각-언어 표현의 품질이 향상되는가?
  • RQ5다양한 코드북 크기와 손실 가중치 설정이 제로샷 환경에서의 최종 검색 성능에 미치는 영향은 어떠한가?

주요 결과

  • CODIS는 MSCOCO 제로샷 벤치마크에서 텍스트 검색 시 59.38% R@1, 이미지 검색 시 44.71% R@1의 새로운 SoTA 성능을 기록하여 ALBEF 및 CLIP와 같은 이전 방법들을 능가한다.
  • 절단 실험 결과, 내모달 및 교차 모달 정렬을 병합한 경우 순수 교차 모달 정렬 대비 R@1이 텍스트 검색에서 +1.26%, 이미지 검색에서 +0.42% 향상됨을 확인하였다.
  • 교수 특징을 사용하여 코드북 손실을 계산할 경우, 학생 특징을 사용하는 것보다 MSCOCO에서 텍스트 검색의 R@1이 +0.38% 향상됨을 확인하였다.
  • Grad-CAM 시각화 결과는 입력 단어에 해당하는 의미적으로 관련된 이미지 영역에 주의를 집중함을 보여주며, 모델이 강력한 정렬 능력을 지닌 것으로 나타났다.
  • 3,000개의 코드워드로 구성된 코드북이 최적의 성능을 보였으며, 500개의 코드워드는 성능이 열등했고, 2.0배 크기의 코드북은 3,000개 대비 약간의 성능 향상을 보였다.
  • MSCOCO 및 Flickr30K 데이터셋 전반에서 일관된 성능 향상을 보였으며, 코드북 없이 기반 모델을 사용한 경우에 비해 MSCOCO에서 텍스트 검색의 R@1이 +2.5% 절대적 향상됨을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.