Skip to main content
QUICK REVIEW

[논문 리뷰] A Fistful of Words: Learning Transferable Visual Models from Bag-of-Words Supervision

Ajinkya Tejankar, Maziar Sanjabi|arXiv (Cornell University)|2021. 12. 27.
Multimodal Machine Learning Applications인용 수 7
한 줄 요약

이 논문은 자연어 설명문의 단순화된, 단어 순서가 뒤섞인 Bag-of-Words (BoW) 설명문이 전수 학습된 자연어 설명문과 유사한 성능을 내는 효과적인 지도 신호로 기능할 수 있음을 보여준다. 이를 통해 BoW 지도 신호를 사용해 훈련된 이동 가능한 시각 모델은 전체 설명문을 사용해 훈련된 모델와 동등한 제로샷 이미지 분류 성능을 달성한다. BoW 지도 신호와 단어 빈도 보정, 그리고 정렬되지 않은 이미지에 대한 자기지도적 가짜 설명문 생성을 조합함으로써, 이 방법은 300만 장의 이미지-설명문 쌍만으로도 ImageNet-1k 제로샷에서 31.5%의 정확도를 달성한다. 이는 1,500만 쌍의 데이터로 훈련된 CLIP 모델의 성능(31.3%)과 동등하다.

ABSTRACT

Using natural language as a supervision for training visual recognition models holds great promise. Recent works have shown that if such supervision is used in the form of alignment between images and captions in large training datasets, then the resulting aligned models perform well on zero-shot classification as downstream tasks2. In this paper, we focus on teasing out what parts of the language supervision are essential for training zero-shot image classification models. Through extensive and careful experiments, we show that: 1) A simple Bag-of-Words (BoW) caption could be used as a replacement for most of the image captions in the dataset. Surprisingly, we observe that this approach improves the zero-shot classification performance when combined with word balancing. 2) Using a BoW pretrained model, we can obtain more training data by generating pseudo-BoW captions on images that do not have a caption. Models trained on images with real and pseudo-BoW captions achieve stronger zero-shot performance. On ImageNet-1k zero-shot evaluation, our best model, that uses only 3M image-caption pairs, performs on-par with a CLIP model trained on 15M image-caption pairs (31.5% vs 31.3%).

연구 동기 및 목표

  • 이미지-설명문 쌍에서 자연어 지도 신호의 어떤 구성 요소가 제로샷 시각 분류에 필수적인가를 조사하는 것.
  • 구조가 없는 비문법적 설명문인 Bag-of-Words (BoW)가 전체 설명문으로 대체되어도 성능 저하 없이 작동하는가를 판단하는 것.
  • 설명문이 없는 정렬되지 않은 이미지를 어떻게 활용할 수 있는지 탐색하기 위해, 가짜 BoW 설명문을 생성함으로써 훈련 데이터를 확장하는 방법을 모색하는 것.
  • 자기학습 유사 프레임워크를 사용해 실제 및 가짜 레이블 데이터를 결합함으로써 제로샷 일반화 성능을 향상시키는 것.
  • 비언어적 구조에 대한 시각-언어 모델의 강건성과 텍스트 인코더의 불변성의 역할을 이해하는 것.

제안 방법

  • 단어 순서를 뒤섞거나, 위치나 빈도 기반으로 단어를 제거하거나, 제한된 어휘를 사용함으로써 전체 설명문을 Bag-of-Words (BoW)로 변형하는 것.
  • 단모달 자기지도 학습을 적용: 시각 인코더에는 BYOL, 텍스트 인코더에는 BERT를 사용하여 입력의 변형에 대한 강건성을 향상시키는 것.
  • BoW 설명문에서 흔한 단어의 과도한 표현을 줄이기 위해 단어 빈도 보정을 적용함으로써 모델의 일반화 성능을 향상시키는 것.
  • 대조적 사전에서 가장 가까운 설명문을 검색하고 상위 단어를 필터링하여 정렬되지 않은 이미지에 대해 가짜 BoW 설명문을 생성하는 것.
  • 실제 이미지-설명문 쌍과 가짜 레이블이 부여된 정렬되지 않은 이미지를 포함한 반정렬 데이터셋을 사용해 최종 시각-언어 모델을 훈련하는 것.
  • 자기지도 학습 중에 이미지 및 텍스트 임베딩 간의 대비 손실을 적용하여 모odal 간의 정렬을 도모하며, CLIP와 유사한 방식을 사용하는 것.

실험 결과

연구 질문

  • RQ1문법적 구조가 제거된 Bag-of-Words (BoW) 설명문은 제로샷 시각 인식 모델 훈련에 효과적인 지도 신호로 기능할 수 있는가?
  • RQ2BoW 설명문에 단어 빈도 보정을 적용하면, 균형이 맞지 않은 BoW나 전체 설명문보다 제로샷 성능이 향상되는가?
  • RQ3BoW 설명문으로 훈련된 모델는 전체 설명문으로 훈련된 모델와 동일한 수준의 제로샷 이미지 분류 성능을 보일 수 있는가?
  • RQ4정렬되지 않은 이미지를 얼마나 효과적으로 활용할 수 있으며, 가짜 BoW 설명문 생성을 통해 성능 향상이 가능한가?
  • RQ5텍스트 인코더의 아키텍처는 단어 뒤섞기와 같은 입력 변형에 대해 어떤 방식으로 불변성을 확보하는가?

주요 결과

  • 전체 설명문 대신 BoW 설명문을 사용해 훈련하면 제로샷 성능이 유사하게 유지되며, ImageNet-1k에서 30.1%의 정확도를 기록했고, 전체 설명문을 사용한 경우는 29.5%였다.
  • BoW 설명문에 단어 빈도 보정을 적용하면 제로샷 정확도가 30.1%로 향상되었으며, 균형이 맞지 않은 BoW나 전체 설명문을 모두 초월했다.
  • BoW 지도 신호를 사용해 오직 300만 장의 이미지-설명문 쌍만으로도 ImageNet-1k 제로샷에서 31.5%의 정확도를 달성했으며, 이는 1,500만 쌍으로 훈련된 CLIP 모델의 성능(31.3%)과 동등했다.
  • 가장 가까운 이웃 검색과 BoW 필터링을 사용해 정렬되지 않은 이미지에 대해 가짜 설명문을 생성함으로써 성능 향상이 이루어졌으며, 반정렬 학습의 가능성과 타당성이 입증되었다.
  • 자기지도 학습(BYOL 및 BERT)을 사용함으로써 모델가 단어 뒤섞기와 같은 언어적 변형에 대해 강건성을 유지할 수 있었다.
  • 다소 유망한 성과가 있었지만, 일부 설정에서는 반정렬 학습이 제한된 성능 향상만을 가져왔으며, 이는 완전히 지도 학습이나 반지도 학습 대비 여전히 도전적인 설정임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.