Skip to main content
QUICK REVIEW

[논문 리뷰] Unified Contrastive Learning in Image-Text-Label Space

Jianwei Yang, Chunyuan Li|arXiv (Cornell University)|2022. 04. 07.
Multimodal Machine Learning Applications인용 수 6
한 줄 요약

이 논문은 단일 학습 목표를 사용하여 공통의 이미지-텍스트-라벨 공간에 이미지-라벨 및 이미지-텍스트 데이터를 통합하는 새로운 대비 학습 프레임워크인 유니티드 대비 학습(uniCL)을 제안한다. 감독 학습 및 웹 크롤링 데이터를 모두 활용함으로써, 유니CL은 제로샷, 선형 프로브, 파인튜닝, 전이 학습 벤치마크 전반에서 최신 기술 수준의 성능을 달성하며, CLIP 및 감독 학습 방법보다 평균적으로 각각 14.5%와 9.2% 높은 성능을 기록한다.

ABSTRACT

Visual recognition is recently learned via either supervised learning on human-annotated image-label data or language-image contrastive learning with webly-crawled image-text pairs. While supervised learning may result in a more discriminative representation, language-image pretraining shows unprecedented zero-shot recognition capability, largely due to the different properties of data sources and learning objectives. In this work, we introduce a new formulation by combining the two data sources into a common image-text-label space. In this space, we propose a new learning paradigm, called Unified Contrastive Learning (UniCL) with a single learning objective to seamlessly prompt the synergy of two data types. Extensive experiments show that our UniCL is an effective way of learning semantically rich yet discriminative representations, universally for image recognition in zero-shot, linear-probe, fully finetuning and transfer learning scenarios. Particularly, it attains gains up to 9.2% and 14.5% in average on zero-shot recognition benchmarks over the language-image contrastive learning and supervised learning methods, respectively. In linear probe setting, it also boosts the performance over the two methods by 7.3% and 3.4%, respectively. Our study also indicates that UniCL stand-alone is a good learner on pure image-label data, rivaling the supervised learning methods across three image classification datasets and two types of vision backbones, ResNet and Swin Transformer. Code is available at https://github.com/microsoft/UniCL.

연구 동기 및 목표

  • 기존 방법들이 이미지-라벨 및 이미지-텍스트 데이터를 별도로 다루기 때문에 강력한 분류 성능나아가 넓은 개념 커버리지 중 하나만 확보할 수 있는 한계를 해결하기 위해.
  • 공통의 이미지-텍스트-라벨 공간을 도입하여 감독 학습과 언어-이미지 대비 학습을 단일 목표 아래 통합하기 위해.
  • 두 데이터 유형을 원활하게 통합하여 의미적으로 풍부하고 분류 성능이 뛰어난 시각적 표현을 학습할 수 있는 통합 학습 프레리그램을 개발하기 위해.
  • UniCL이 다양한 최종 비전 작업에서 감독 학습 및 대비 학습 방법을 모두 능가할 수 있음을 입증하기 위해.
  • UniCL이 오직 이미지-라벨 데이터로만 훈련되어도 여러 데이터셋과 백본에서 감독 기반 기준선 수준의 성능을 낼 수 있음을 보여주기 위해.

제안 방법

  • 이 방법은 각 이미지가 라벨과 해당 텍스트 설명과 연결된 통합된 이미지-텍스트-라벨 공간을 도입하여, 두 데이터 유형에서의 공동 학습을 가능하게 한다.
  • 시각적 인코더와 텍스트 인코더를, 공통 라벨에서 유도된 부드러운 타겟을 사용한 대비 손실을 통해 이미지 및 텍스트 특징을 정렬하도록 훈련한다.
  • 통합된 대비 학습 목표는 온전한 온도 조정 기반 교차 어텐션을 사용하는 단일 손실 함수를 통해 이미지-라벨 쌍에서 온 감독과 이미지-텍스트 쌍에서 온 정렬을 결합한다.
  • 이 프레임워크는 순수 이미지-라벨 데이터, 순수 이미지-텍스트 데이터, 또는 둘 다를 사용한 훈련을 지원하며, 아키텍처나 훈련 파ip라인에 변화 없이 가능하다.
  • 이 방법은 데이터 증강과 온도 기반 대비 손실을 사용하여 특징의 분류 성능 향상과 의미적 정렬을 개선한다.
  • 이 접근법은 두 데이터 유형의 장점을 유기적으로 활용함으로써 특징 품질을 종합적으로 향상시키는 엔드 투 엔드 훈련을 가능하게 한다.

실험 결과

연구 질문

  • RQ1통합 학습 프레임워크는 이미지-라벨 및 이미지-텍스트 데이터를 효과적으로 융합하여 시각적 표현 학습을 향상시킬 수 있는가?
  • RQ2공통 공간에서 감독 학습과 대비 학습을 융합하면 제로샷, 선형 프로브, 파인튜닝 설정 전반에서 성능 향상이 이루어지는가?
  • RQ3UniCL은 오직 이미지-라벨 데이터로만 훈련되어도 감독 기반 기준선 수준의 성능을 낼 수 있는가?
  • RQ4이미지-라벨 데이터의 포함 여부가 이미지-텍스트 쌍으로 사전 훈련된 모델의 분류 성능에 어떤 영향을 미치는가?
  • RQ5데이터 통합은 특히 클래스 간 분리도 측면에서 특징 공간 품질에 어떤 영향을 미치는가?

주요 결과

  • UniCL은 제로샷 인식 벤치마크에서 언어-이미지 대비 학습 방법보다 평균 9.2% 향상되었고, 감독 학습 방법보다는 14.5% 향상되었다.
  • 선형 프로브 설정에서는 CLIP보다 7.3% 향상되었고, 감독 기반 기준선보다는 3.4% 향상되었다.
  • YFCC-14M의 절반과 ImageNet-21K의 절반을 사용해 훈련한 경우, UniCL은 CLIP 대비 ImageNet-1K 제로샷 정확도에서 6%의 절대적 향상을 기록했다.
  • 두 데이터 유형을 결합했을 때 14개의 최종 적용 데이터셋 중 11개에서 승리하며, 7%의 절대적 향상을 기록했다.
  • t-SNE 시각화 결과 UniCL이 더 분류 성능이 뛰어난 특징 공간을 생성함을 확인했으며, 개 품종과 같은 세분화된 클래스들조차도 해당 클래스에 대한 명시적 지도 없이도 명확히 분리되어 있음을 보여주었다.
  • 오직 이미지-라벨 데이터로만 훈련된 UniCL은 세 개의 이미지 분류 데이터셋과 두 가지 백본 아키텍처(ResNet 및 Swin Transformer)에서 감독 학습 방법과 경쟁 수준의 성능을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.