Skip to main content
QUICK REVIEW

[논문 리뷰] Three Towers: Flexible Contrastive Learning with Pretrained Image Models

Jannik Kossen, Mark Collier|arXiv (Cornell University)|2023. 05. 26.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

Three Towers (3T)는 대조적 학습 프레임워크를 도입하여, 고정된 사전 훈련된 이미지 분류기 임베딩을 제3의 타워를 통해 통합함으로써 시각-언어 모델의 성능을 향상시킨다. 이와 동시에 주 이미지 및 텍스트 타워는 대조 손실을 통해 공동으로 훈련될 수 있도록 한다. 이 방법은 이미지 인식 및 분류 과제에서 LiT 및 초기 훈련 베이스라인을 일관되게 능가하며, 특히 ImageNet-21k나 Places365와 같은 다양한 사전 훈련 데이터셋에서 두드러진 성능을 보인다.

ABSTRACT

We introduce Three Towers (3T), a flexible method to improve the contrastive learning of vision-language models by incorporating pretrained image classifiers. While contrastive models are usually trained from scratch, LiT (Zhai et al., 2022) has recently shown performance gains from using pretrained classifier embeddings. However, LiT directly replaces the image tower with the frozen embeddings, excluding any potential benefits from training the image tower contrastively. With 3T, we propose a more flexible strategy that allows the image tower to benefit from both pretrained embeddings and contrastive training. To achieve this, we introduce a third tower that contains the frozen pretrained embeddings, and we encourage alignment between this third tower and the main image-text towers. Empirically, 3T consistently improves over LiT and the CLIP-style from-scratch baseline for retrieval tasks. For classification, 3T reliably improves over the from-scratch baseline, and while it underperforms relative to LiT for JFT-pretrained models, it outperforms LiT for ImageNet-21k and Places365 pretraining.

연구 동기 및 목표

  • LiT의 한계를 해결하기 위해, 사전 훈련된 이미지 임베딩을 고정함으로써 이미지 타워가 대조 학습의 이점을 얻을 수 없게 되는 문제를 해결한다.
  • 사전 훈련된 이미지 표현과 대조 신호를 동시에 활용할 수 있는 융통성 있는 방법을 개발하여, 시각-언어 모델에서의 공동 학습을 가능하게 한다.
  • 특히 사전 훈련된 모델이 열악하거나 다운스트림 데이터와 불일치할 경우에도, 다양한 다운스트림 과제에서의 강인성과 성능 향상을 도모한다.
  • 모듈러한 세 개의 타워 아키텍처를 통해 사전 지식과 대조 학습의 인덕티브 바이어스 사이의 트레이드오프를 가능하게 한다.
  • 사전 훈련된 임베딩과 대조 학습을 결합함으로써, 순수하게 고정된 임베딩에 의존하거나 초기 훈련에서부터 시작하는 것보다 더 나은 일반화 성능을 달성할 수 있음을 경험적으로 검증한다.

제안 방법

  • 이미지 분류기(예: ImageNet-21k 또는 Places365)에서 유도된 고정된 사전 훈련된 이미지 임베딩을 포함하는 제3의 타워를 도입하며, 이는 주 이미지 및 텍스트 타워와는 별개로 운영된다.
  • 웹 스크래핑된 이미지-캡션 쌍을 기반으로, 주 이미지 및 텍스트 타워를 초기 훈련에서부터 대조 학습을 통해 훈련한다.
  • 주 이미지 타워를 제3의 타워(사전 훈련된 임베딩)와 정렬하기 위해 추가적인 대조 손실 항목을 적용함으로써 지식 전이를 가능하게 한다.
  • 멀티헤드 어텐션 풀링을 사용하여, 주 이미지 타워와 제3의 타워 모두에서 패치 임베딩을 하나의 표현으로 통합한다.
  • Adafactor 최적화기를 사용하여 전체 모델을 최적화하며, 학습률 웜업,余弦 감쇠, 기울기 클리핑, 가중치 감쇠를 적용한다.
  • 추론 효율성을 유지하기 위해 테스트 시 제3의 타워를 제거하고, 다운스트림 과제를 위해 주 이미지 및 텍스트 타워만 사용한다.

실험 결과

연구 질문

  • RQ1고정된 사전 훈련된 이미지 임베딩과 훈련 가능한 이미지 타워를 융합함으로써, 대조적 시각-언어 학습을 향상시킬 수 있는가?
  • RQ2제안된 Three Towers 프레임워크가 검색 및 제로샷 분류 과제에서 LiT 및 초기 훈련 베이스라인을 능가하는가?
  • RQ3Places365 사전 훈련 모델을 사용할 경우, 3T는 다운스트림 과제에서 어떻게 성능을 내는가?
  • RQ4사전 훈련된 모델이 특정 이미지 카테고리나 도메인을 커버하지 못할 경우, 이 방법은 여전히 강인한가?
  • RQ5ImageNet-21k 및 JFT와 같은 다양한 사전 훈련 데이터셋에서 3T는 LiT를 뛰어넘는 성능을 달성할 수 있는가?

주요 결과

  • 3T는 Flickr30k 및 COCO 검색 벤치마크에서 LiT 및 초기 훈련 베이스라인을 모두 능가하는 상위 1순위 리콜 성능을 기록하였으며, 각각 img2txt 87.3% 및 txt2img 48.5%를 달성하였다.
  • ImageNet-1k 제로샷 분류 과제에서 3T는 초기 훈련 베이스라인을 능가했으며, ImageNet-21k 사전 훈련 모델을 사용할 경우 LiT와 동등하거나 이를 초월하는 성능을 보였다.
  • Places365 사전 훈련 모델을 사용할 경우, 3T는 LiT가 ImageNet-1k 및 CIFAR-100과 같은 다운스트림 과제에서 일반화에 실패하는 것을 고려할 때 뚜렷이 슈퍼리어한 성능을 보였다.
  • 3T는 사전 훈련 데이터셋의 한계에 대해 더 강인한 성능을 보였으며, 특히 사전 훈련된 모델의 레이블이나 분포가 다운스트림 과제와 일치하지 않을 경우 두드러진 성능 향상을 보였다.
  • 모델 스케일이 클수록 더 큰 이점을 얻었으며, L-스케일 모델의 경우 약 3일간 256개의 TPU 칩에서 수렴함을 관찰하였다.
  • G-스케일 모델의 경우, 512개의 TPU 칩에서 약 5일간 수렴하였으며, $eta_2$를 0.95로 조정함으로써 훈련 안정성이 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.