Skip to main content
QUICK REVIEW

[논문 리뷰] Global and Local Mixture Consistency Cumulative Learning for Long-tailed Visual Recognitions

Fei Du, Peng Yang|arXiv (Cornell University)|2023. 05. 15.
Domain Adaptation and Few-Shot Learning인용 수 5
한 줄 요약

이 논문은 장수분포 시각 인식에서 특징 추출기의 강건성과 함께 헤드클래스 편향을 완화하기 위해 글로벌(_mixup_) 및 로컬(_cutmix_) 증강 일관성과 함께 에포크 누적, 클래스 빈도 재가중 소프트 레이블을 활용하는 단일 단계 훈련 프레임워크인 글로벌 및 로컬 혼합 일관성 누적 학습(GLMC)을 제안한다. GLMC는 CIFAR-10-LT, CIFAR-100-LT, ImageNet-LT에서 최신 기준 성능을 달성하며, 균형 잡힌 ImageNet 및 CIFAR 데이터셋에서도 뚜렷한 일반화 성능 향상을 보였다.

ABSTRACT

In this paper, our goal is to design a simple learning paradigm for long-tail visual recognition, which not only improves the robustness of the feature extractor but also alleviates the bias of the classifier towards head classes while reducing the training skills and overhead. We propose an efficient one-stage training strategy for long-tailed visual recognition called Global and Local Mixture Consistency cumulative learning (GLMC). Our core ideas are twofold: (1) a global and local mixture consistency loss improves the robustness of the feature extractor. Specifically, we generate two augmented batches by the global MixUp and local CutMix from the same batch data, respectively, and then use cosine similarity to minimize the difference. (2) A cumulative head tail soft label reweighted loss mitigates the head class bias problem. We use empirical class frequencies to reweight the mixed label of the head-tail class for long-tailed data and then balance the conventional loss and the rebalanced loss with a coefficient accumulated by epochs. Our approach achieves state-of-the-art accuracy on CIFAR10-LT, CIFAR100-LT, and ImageNet-LT datasets. Additional experiments on balanced ImageNet and CIFAR demonstrate that GLMC can significantly improve the generalization of backbones. Code is made publicly available at https://github.com/ynu-yangpeng/GLMC.

연구 동기 및 목표

  • 장수분포 시각 인식 데이터셋에서 헤드클래스 편향과 열악한 일반화 성능 문제를 해결한다.
  • 다단계 훈련의 복잡성과 오버헤드를 피하는 단일 단계 훈련 철학을 개발한다.
  • 부정 샘플 쌍이나 대용량 배치 훈련이 필요 없이 특징 추출기의 강건성을 향상시킨다.
  • 에포크 누적, 적응형 레이블 재가중을 통해 분류기의 헤드클래스 편향을 완화한다.
  • 장수분포 및 균형 잡힌 이미지 분류 벤치마크에서 백본의 일반화 성능 향상을 높인다.

제안 방법

  • 동일 배치 내에서 글로벌 혼합(_mixup_)과 로컬 혼합(_cutmix_) 증강에 의해 생성된 표현 간의 음의 코사인 유사도를 최소화하는 글로벌 및 로컬 혼합 일관성 손실을 도입한다.
  • 역전파 동안 일관성 손실의 학습 안정성을 확보하기 위해 정지 기울기(Stop-gradient) 연산을 적용한다.
  • 실제 관측된 클래스 빈도를 활용해 헤드클래스와 테일클래스의 혼합 레이블을 재가중하여 클래스 균형 잡힌 손실 성분을 생성한다.
  • 표준 교차 엔트로피 손실과 재가중된 손실을 에포크에 걸쳐 누적되는 계수를 사용해 조합한다.
  • 아키텍처 변경이나 추가 구성 요소 없이 감독 훈련에 보조 손실로 구현한다.
  • 대표 특징 사전 학습이나 분류기 미세조정이 필요 없이 단일 단계에서 종합적으로 모델을 훈련한다.

실험 결과

연구 질문

  • RQ1다단계 훈련 없이도 단일 단계 훈련 전략이 장수분포 시각 인식에서 헤드클래스 편향을 효과적으로 완화할 수 있는가?
  • RQ2글로벌 및 로컬 데이터 증강 일관성의 조합이 특징 추출기의 강건성 향상에 어떻게 기여하는가?
  • RQ3적응형, 에포크 누적 레이블 재가중 전략이 장수분포 데이터셋에서 헤드클래스 편향을 어느 정도 감소시킬 수 있는가?
  • RQ4제안된 방법은 장수분포 벤치마크를 초월해 균형 잡힌 데이터셋인 ImageNet 및 CIFAR와 같은 기준으로 일반화 가능한가?
  • RQ5혼합 일관성과 누적 재가중의 상대적 기여도는 전체 성능 향상에 얼마나 기여하는가?

주요 결과

  • GLMC는 불균형 요인 100인 CIFAR-100-LT에서 83.05%의 Top-1 정확도를 기록하여 PaCo보다 3.95% 높고, 바닐라 교차 엔트로피보다 7.77% 높았다.
  • ImageNet-LT에서 GLMC는 80.2%의 Top-1 정확도를 달성하여 PaCo보다 0.9% 높고, SupCon보다 1.8% 높았다.
  • 글로벌 및 로컬 혼합 일관성 손실만으로도 불균형 요인 100인 CIFAR-100-LT에서 정확도가 38.3%에서 50.11%로 11.81% 향상되었다.
  • 누적 재가중 전략은 헤드클래스 편향을 크게 감소시켰으며, 최적의 성능는 레이블 재가중 계수 1.0에서 달성되었다.
  • 균형 잡힌 ImageNet 및 CIFAR-100에서 GLMC는 백본의 일반화 성능을 향상시켜 장수분포 특화 수정 없이도 ImageNet에서 80.2%의 Top-1 정확도를 달성했다.
  • 제거 실험을 통해 혼합 일관성과 누적 재가중 둘 다 필수적임을 확인하였으며, 둘 다 사용했을 때 최고의 성능가 달성되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.