Skip to main content
QUICK REVIEW

[논문 리뷰] Semi-supervised Long-tailed Recognition using Alternate Sampling

Bo Liu, Haoxiang Li|arXiv (Cornell University)|2021. 05. 01.
Domain Adaptation and Few-Shot Learning참고 문헌 27인용 수 4
한 줄 요약

이 논문은 특성 임bedding과 분류기 학습을 분리하여, 라벨이 있는 데이터에 대해 클래스 균형 샘플링을 사용하고, 라벨이 있는 및 없는 데이터에 대해 임의의 샘플링을 사용하는 새로운 준지도 학습 장수인식 프레임워크를 제안한다. 반복적으로 허위 레이블을 개선하고 꼬리 클래스에서 저품질의 허위 레이블로 인한 편향을 완화함으로써, 특히 소수의 클래스에서 최신 기술 성능을 달성한다.

ABSTRACT

Main challenges in long-tailed recognition come from the imbalanced data distribution and sample scarcity in its tail classes. While techniques have been proposed to achieve a more balanced training loss and to improve tail classes data variations with synthesized samples, we resort to leverage readily available unlabeled data to boost recognition accuracy. The idea leads to a new recognition setting, namely semi-supervised long-tailed recognition. We argue this setting better resembles the real-world data collection and annotation process and hence can help close the gap to real-world scenarios. To address the semi-supervised long-tailed recognition problem, we present an alternate sampling framework combining the intuitions from successful methods in these two research areas. The classifier and feature embedding are learned separately and updated iteratively. The class-balanced sampling strategy has been implemented to train the classifier in a way not affected by the pseudo labels' quality on the unlabeled data. A consistency loss has been introduced to limit the impact from unlabeled data while leveraging them to update the feature embedding. We demonstrate significant accuracy improvements over other competitive methods on two datasets.

연구 동기 및 목표

  • 표준 준지도 학습 벤치마크와 실제 데이터 수집 간의 격차를 해결하라. 여기서 라벨이 있는 데이터와 없는 데이터 모두 장수 분포를 따른다.
  • 표준 방법이 클래스 불균형으로 인해 실패하는 준지도 학습 장수인식에서 꼬리 클래스의 허위 레이블 품질이 열 劣한 문제를 해결하라.
  • 분류기와 특성 임베딩 학습을 분리하여 훈련을 안정화하고 노이즈가 많은 허위 레이블에 대한 강건성을 향상시키는 훈련 프레임워크를 개발하라.
  • 라벨이 없는 데이터를 활용하여 장수 데이터셋에서의 인식 정확도를 향상시키되, 헤드 클래스에 대한 편향을 악화시키지 않도록 하라.

제안 방법

  • 인식 모델을 특성 임베딩 네트워크와 분류기로 분리하여, 서로 다른 샘플링 전략을 사용해 별도로 훈련한다.
  • 라벨이 있는 부분집합에서 분류기 훈련에 대해 클래스 균형 샘플링을 사용하여 공정한 감독을 확보하고 헤드 클래스에 대한 편향을 줄인다.
  • 라벨이 있는 및 없는 데이터에 대해 특성 임베딩 훈련에 대해 임의의 샘플링을 적용하여 잠재적으로 잘못된 허위 레이블에서 비롯된 편향을 방지한다.
  • 다른 증강을 적용한 동일한 라벨이 없는 샘플에 대한 전방향 통과 간의 일致성 손실을 도입하여 특성 일반화를 향상시킨다.
  • 교대로 학습하는 방식을 구현한다: 먼저 라벨이 있는 데이터에서 분류기를 훈련하고, 그 다음에 허위 레이블이 부여된 라벨이 없는 데이터를 사용해 특성 임베딩을 업데이트하며, 이를 반복한다.
  • 현재 모델의 허위 레이블을 특성 임베딩 훈련을 위한 감독으로 사용하지만, 허위 레이블이 부여된 데이터에 대해 분류기를 업데이트하지 않아 오류 전파를 방지한다.

실험 결과

연구 질문

  • RQ1라벨이 있는 데이터와 없는 데이터가 모두 동일한 장수 분포를 따를 때, 준지도 학습 기법을 장수 인식에 효과적으로 적용할 수 있는가?
  • RQ2꼬리 클래스의 허위 레이블 품질이 준지도 학습 장수 인식에서 모델 성능에 미치는 영향은 어떠한가?
  • RQ3다른 샘플링 전략을 사용해 분류기와 특성 임베딩 학습을 분리하면 편향을 줄이고 노이즈가 많은 허위 레이블에 대한 강건성을 향상시킬 수 있는가?
  • RQ4분류기와 특성 임베딩 학습 간의 교대로 학습이 공동 학습이나 종단 간 최적화보다 소수 클래스에서 성능을 향상시키는가?

주요 결과

  • 제안된 방법은 CIFAR-10-SSLT(불균형 요인 100)에서 전체 정확도 70.1%를 달성하여 최고의 베이스라인보다 6个百分点 이상 뛰어나다.
  • 소수 클래스에서는 56.5%의 정확도를 달성하여, 베이스라인(14.1% with R+R 및 37.6% with C+R)에 비해 상당한 향상이 있었으며, 허위 레이블 노이즈에 강건함을 입증한다.
  • 절단 실험 결과, 허위 레이블이 부여된 데이터에서 분류기를 훈련하는 것(클래스 균형 샘플링을 사용하더라도) 성능을 악화시키며, 특히 소수 클래스에서 오류 전파로 인해 악영향을 미친다.
  • 5轮의 훈련 루프 동안 라벨이 없는 부분집합에서의 허위 레이블 정확도가 소수 분할에서 41.8%에서 57.8%로 상승하여, 교대로 학습 방식의 효과를 확인한다.
  • 특성 임베딩의 무 supervision 훈련을 제거하면 성능이 급격히 떨어지며, 초기화된 모델보다 열 劣한 성능을 보여, 무 supervision 훈련이 향상에 필수적임을 증명한다.
  • 많은 수의 클래스에서는 높은 성능(전체 89.6%)을 유지하면서도 소수 클래스의 정확도를 크게 향상시켜, 클래스 기수에 관계없이 균형 잡힌 학습이 이루어짐을 나타낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.