Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Cross-Modal Representation Learning with Progressive Self-Distillation

Alex Andonian, Shixing Chen|arXiv (Cornell University)|2022. 04. 10.
Multimodal Machine Learning Applications인용 수 6
한 줄 요약

이 논문은 웹에서 수확한 데이터셋에서 노이즈가 많고 다对다 대응 관계가 있는 상황을 다루기 위해 훈련 중에 소프트 이미지-텍스트 정렬 타겟을 동적으로 생성하는 점진적 자기정규화 프레임워크를 제안한다. 훈련 에포크 동안 자신의 지식을 자기 자신에게 전달함으로써, 추가 계산 없이 CLIP보다 더 높은 성능을 내며 제로샷 분류, 선형 프로빙, 검색 성능을 향상시키며 분포 이탈에 대한 강건성도 향상시키고 데이터 크기에 따라 확장 가능하다.

ABSTRACT

The learning objective of vision-language approach of CLIP does not effectively account for the noisy many-to-many correspondences found in web-harvested image captioning datasets, which contributes to its compute and data inefficiency. To address this challenge, we introduce a novel training framework based on cross-modal contrastive learning that uses progressive self-distillation and soft image-text alignments to more efficiently learn robust representations from noisy data. Our model distills its own knowledge to dynamically generate soft-alignment targets for a subset of images and captions in every minibatch, which are then used to update its parameters. Extensive evaluation across 14 benchmark datasets shows that our method consistently outperforms its CLIP counterpart in multiple settings, including: (a) zero-shot classification, (b) linear probe transfer, and (c) image-text retrieval, without incurring added computational cost. Analysis using an ImageNet-based robustness test-bed reveals that our method offers better effective robustness to natural distribution shifts compared to both ImageNet-trained models and CLIP itself. Lastly, pretraining with datasets spanning two orders of magnitude in size shows that our improvements over CLIP tend to scale with number of training examples.

연구 동기 및 목표

  • 노이즈가 많고 일대일 대응 관계를 가정하는 CLIP의 데이터 및 계산 비효율성을 해결하기 위해.
  • CLIP가 忽시하는 음성 샘플 간의 의미 유사도를 모델링하여 교차모달 표현 학습의 강건성을 향상시키기 위해.
  • 외부 감독이나 노이즈 데이터 보정이 필요 없이 동적으로 소프트 정렬 타겟을 생성하는 자기정규화 프레임워크를 개발하기 위해.
  • 추가 계산 비용 없이 추론 효율성을 유지하면서도 분포 이탈에 대한 강건성과 하류 성능을 향상시키기 위해.
  • 성능 향상이 훈련 데이터 크기에 따라 확장됨을 입증하여 더 넓은 적용 가능성을 확보하기 위해.

제안 방법

  • 학생-선생 프레임워크를 사용하여, 학생 모델이 자신의 진화하는 파rameter에 의해 생성된 소프트 정렬 타겟을 점진적으로 학습한다.
  • 각 미니배치에서, 이미지와 캡션의 무작위 부분 집합에 대해 현재 모델 예측 기반으로 소프트 정렬 타겟을 할당함으로써, 잘못 매핑된 쌍에 대한 동적 재보정이 가능하다.
  • 자기정규화 과정에서 자신의 실수를 강화하지 않도록 하기 위해, 표현 붕괴를 방지하기 위해 교환 예측 전략을 채택한다.
  • 점진적인 지식 정규화를 가능하게 하기 위해, 훈련 중에 소프트 정렬 생성에 사용되는 샘플 비율을 점차 증가시키는 동적 분할 전략을 적용한다.
  • 대비 손실은 이러한 소프트 타겟을 사용하여 최적화되어, 더 일관되고 강건한 공동 임베딩 공간을 학습할 수 있도록 한다.
  • 계산 비용이 들지 않으며, 기존의 CLIP 스타일 훈련 파이프라인과 호환되며, 추가 파라미터나 계산 비용 없이도 작동한다.

실험 결과

연구 질문

  • RQ1노이즈가 많고 다대다 이미지-텍스트 데이터셋에서 소프트 정렬 타겟을 활용한 자기정규화는 교차모달 표현 학습의 강건성을 향상시키는가?
  • RQ2음성 샘플 간의 의미 유사도를 모델링하면, 하드 음성 샘플 마이닝이나 표준 대비 손실 학습에 비해 더 나은 하류 성능과 강건성을 달성하는가?
  • RQ3CLIP에 비해 제안된 방법의 성능은 증가하는 훈련 데이터 크기에 따라 어떻게 확장되는가?
  • RQ4표현 붕괴나 실수 강화 없이, 모델이 자신의 예측에서 지식을 효과적으로 자기정규화할 수 있는가?
  • RQ5CLIP나 ImageNet 미사전학습 모델에 비해 자연적인 분포 이탈에 대해 더 높은 효과적 강건성을 달성하는가?

주요 결과

  • 제안된 방법은 추가 계산 비용 없이 14개의 벤치마크 데이터셋에서 제로샷 분류, 선형 프로빙, 이미지-텍스트 검색 성능에서 CLIP를 모두 초월한다.
  • ImageNet-R 강건성 벤치마크에서, CLIP와 ImageNet 미사전학습 모델 모두보다 자연적인 분포 이탈에 대해 뛰어난 효과적 강건성을 보였다.
  • COCO 사전학습 기반으로 제로샷 ImageNet Top-1 정확도 23.51%를 달성하여 CLIP 기준선을 초월했으며, 검색 작업에서 평균 랭크 1 재현율(MS R1)은 28.48%를 기록했다.
  • 제거 실험 결과, 모델의 사후확률에서 직접 부스팅하는 것은 성능 저하를 초래하지만, 제안된 동적 분할 전략과 교환 예측 전략은 기준선 성능을 복원하고 이를 초월함을 확인했다.
  • CLIP에 대한 성능 향상은 훈련 데이터 크기에 따라 확장되며, 더 큰 데이터셋에서의 강력한 일반화 잠재력을 시사한다.
  • 정성적 분석 결과, 모델이 더 종합적인 의미적 매칭을 포착하여, 단일 속성에 집중하는 CLIP와 달리, 텍스트 쿼리의 여러 측면에 부합하는 이미지를 검색함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.