Skip to main content
QUICK REVIEW

[논문 리뷰] A Simple Long-Tailed Recognition Baseline via Vision-Language Model

Teli Ma, Shijie Geng|arXiv (Cornell University)|2021. 11. 29.
Multimodal Machine Learning Applications참고 문헌 40인용 수 10
한 줄 요약

이 논문은 장기적 분포 문제를 해결하기 위해 대비 시각-언어 모델을 활용하는 간단하면서도 효과적인 long-tailed 인식 기반 모델 BALLAD를 제안한다. 이는 먼저 장기적 데이터에서 계속해서 미리 훈련한 후, 균형 잡힌 샘플에서 선형 어댑터를 통해 미세조정하는 두 단계 훈련 방식을 취한다. 이는 ResNet-50 ×16를 사용할 때 ImageNet-LT에서 최고의 성능을 기록하며, 이전 방법들보다 최대 7.2% 높은 76.5%의 top-1 정확도를 달성한다.

ABSTRACT

The visual world naturally exhibits a long-tailed distribution of open classes, which poses great challenges to modern visual systems. Existing approaches either perform class re-balancing strategies or directly improve network modules to address the problem. However, they still train models with a finite set of predefined labels, limiting their supervision information and restricting their transferability to novel instances. Recent advances in large-scale contrastive visual-language pretraining shed light on a new pathway for visual recognition. With open-vocabulary supervisions, pretrained contrastive vision-language models learn powerful multimodal representations that are promising to handle data deficiency and unseen concepts. By calculating the semantic similarity between visual and text inputs, visual recognition is converted to a vision-language matching problem. Inspired by this, we propose BALLAD to leverage contrastive vision-language models for long-tailed recognition. We first continue pretraining the vision-language backbone through contrastive learning on a specific long-tailed target dataset. Afterward, we freeze the backbone and further employ an additional adapter layer to enhance the representations of tail classes on balanced training samples built with re-sampling strategies. Extensive experiments have been conducted on three popular long-tailed recognition benchmarks. As a result, our simple and effective approach sets the new state-of-the-art performances and outperforms competitive baselines with a large margin. Code is released at https://github.com/gaopengcuhk/BALLAD.

연구 동기 및 목표

  • 헤드 클래스가 지배하고 꼬리 클래스가 데이터 부족으로 어려움을 겪는 장기적 데이터 분포 문제를 해결한다.
  • 언어 모odal이 부족한 클래스의 표현 학습을 향상시키기 위해 보완적인 지도를 제공할 수 있는지 탐색한다.
  • 이전 방법들이 시각 모달에만 의존하고 고정된 레이블 세트를 사용하는 데서 비롯되는 제약을 해결하여, 새로운 또는 드문 카테고리로의 일반화 능력을 향상시킨다.
  • 시각-언어 모델의 오픈 뷰어블(capability)을 활용하여, 적은 샘플 또는 영역 없이도 일반화 능력이 향상된 단순하고 효과적인 기반 모델을 개발한다.
  • 복잡한 아키텍처나 광범위한 초모수 튜닝 없이도 장기적 벤치마크에서 성능을 향상시킨다.

제안 방법

  • 장기적 타겟 데이터셋에서 대비 학습을 통해 다중모odal 표현을 새로운 도메인에 적응시키기 위해, 장기적 데이터에서 시각-언어 기반 모델(예: CLIP)을 계속 미리 훈련한다.
  • 미리 훈련 후 시각-언어 기반 모델의 가중치를 동결하여 학습된 표현을 유지하면서, 미세조정을 위해 학습 가능한 선형 어댑터를 도입한다.
  • 어댑터 훈련 동안 클래스 균형 샘플링을 적용하여, 모든 클래스가 동일하게 표현되는 균형 잡힌 훈련 데이터를 구성한다.
  • 원래 CLIP 특징과 어댑터가 학습한 특징 사이의 상호 보완적 균형을 조절하기 위해 잔차 요소 λ를 사용하여 꼬리 클래스 성능 최적화를 도모한다.
  • 균형 잡힌 샘플에서 교차 엔트로피 손실을 사용하여 어댑터를 훈련함으로써, 저자원 클래스에 특화된 시각적 특징을 개선할 수 있도록 한다.
  • 훈련 과정을 두 단계로 분리한다: A단계는 대비 미리 훈련을 통한 도메인 적응, B단계는 어댑터 미세조정을 통한 클래스별 보정.

실험 결과

연구 질문

  • RQ1시각-언어 모델이 장기적 데이터셋에서 인식 성능 향상에 효과적인 오픈 뷰어블 지도를 제공할 수 있는가?
  • RQ2표준 미세조정 대비 장기적 데이터에서의 계속된 미리 훈련이 표현 학습에 더 나은 영향을 미치는가?
  • RQ3학습 가능한 어댑터 레이어의 통합이 헤드 클래스 정확도를 떨어뜨리지 않고 꼬리 클래스 성능에 어떤 영향을 미치는가?
  • RQ4훈련 데이터의 균형 조절 전략은 언제, 어디서 적용되어야 가장 효과적인가?
  • RQ5장기적 분포 인식 맥락에서 일반화와 수렴성 사이의 최적의 트레이드오프를 이끌어내는 샘플링 전략(클래스 균형, 제곱근, 혼합 균형)은 무엇인가?

주요 결과

  • BALLAD는 ResNet-50 ×16 기반 모델을 사용하여 ImageNet-LT 벤치마크에서 최고의 성능을 기록하며, 이는 이전 방법들보다 최대 7.2% 높은 76.5%의 top-1 정확도를 달성한다.
  • 모델은 적은 샘플 성능을 크게 향상시켰으며, ImageNet-LT의 적은 샘플 서브셋에서 59.5%의 정확도를 기록하여 저자원 클래스로의 일반화 능력이 뛰어나다는 것을 입증한다.
  • 잔차 요소 λ ≈ 0.2를 사용한 선형 어댑터가 최적의 성능을 내며, 이는 미리 훈련 후에 균형 잡힌 작은 적응이 필요하다는 것을 시사한다.
  • 균형 조정 전략을 Phase B(어댑터 훈련)에서만 적용할 경우, Phase A에서 적용하는 것보다 더 좋은 성능을 내며, 강력한 헤드 클래스 표현을 유지한다.
  • Phase B에서 클래스 균형 샘플링 전략이 ImageNet-LT에서 가장 우수한 전체 성능을 기록하며, 제곱근 및 혼합 균형 샘플링 전략을 능가한다.
  • 이 방법은 강력한 제로샷 일반화 능력을 보이며, CLIP의 제로샷 성능(58.2%)이 이미 SOTA 수준이지만, BALLAD는 이를 더욱 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.