[논문 리뷰] On the Effectiveness of Out-of-Distribution Data in Self-Supervised Long-Tail Learning
이 논문은 장수분포 데이터셋에서 성능을 향상시키기 위해 레이블이 없는 외부 분포(OOD) 데이터를 활용하는 새로운 비지도 학습 프레임워크인 COLT을 제안한다. 특징 공간에서 尾(꼬리) 클래스 근처에 동적으로 OOD 샘플을 추출하고, 분포 인식형 대비 손실을 적용함으로써 표현 학습을 크게 향상시킨다. 이로 인해, 비용이 많이 들기 때문에 사용이 제한되는 내부 분포(ID) 데이터에 의존하는 최신 기법들을 능가한다.
Though Self-supervised learning (SSL) has been widely studied as a promising technique for representation learning, it doesn't generalize well on long-tailed datasets due to the majority classes dominating the feature space. Recent work shows that the long-tailed learning performance could be boosted by sampling extra in-domain (ID) data for self-supervised training, however, large-scale ID data which can rebalance the minority classes are expensive to collect. In this paper, we propose an alternative but easy-to-use and effective solution, Contrastive with Out-of-distribution (OOD) data for Long-Tail learning (COLT), which can effectively exploit OOD data to dynamically re-balance the feature space. We empirically identify the counter-intuitive usefulness of OOD samples in SSL long-tailed learning and principally design a novel SSL method. Concretely, we first localize the `head' and `tail' samples by assigning a tailness score to each OOD sample based on its neighborhoods in the feature space. Then, we propose an online OOD sampling strategy to dynamically re-balance the feature space. Finally, we enforce the model to be capable of distinguishing ID and OOD samples by a distribution-level supervised contrastive loss. Extensive experiments are conducted on various datasets and several state-of-the-art SSL frameworks to verify the effectiveness of the proposed method. The results show that our method significantly improves the performance of SSL on long-tailed datasets by a large margin, and even outperforms previous work which uses external ID data. Our code is available at https://github.com/JianhongBai/COLT.
연구 동기 및 목표
- 장수분포 데이터셋에서 주로 다수 클래스가 특징 공간을 지배함에 따라 비지도 학습(SSL)의 일반화 성능이 열 劣하는 문제를 해결하기 위해.
- 내부 분포(ID) 데이터가 확보되지 않거나 수집에 비용이 많이 들 경우, 레이블이 없는 외부 분포(OOD) 데이터가 SSL 성능 향상에 효과적으로 기여할 수 있는지 탐색하기 위해.
- 레이블이 없는 OOD 데이터가 필요 없이 OOD 샘플을 활용해 특징 공간을 동적으로 재균형화하는 실용적이고 데이터 효율적인 방법을 개발하기 위해.
- ID와 OOD 분포를 구분할 수 있는 새로운 대비 학습 목표를 통해 소수 클래스(꼬리 클래스)의 모델 강건성과 선형 가분성을 향상시키기 위해.
제안 방법
- 이웃 밀도 기반으로 특징 공간 내에서 헤드 및 테일 샘플을 비지도적으로 국소화하기 위해 테일니스 스코어를 제안한다.
- 테일 또는 헤드 클래스와 높은 코사인 유사도를 가지는 OOD 샘플을 선택하는 온라인 OOD 샘플링 전략을 설계하며, 예산 인식 함수를 통해 테일 클래스에 더 많은 샘플을 할당한다.
- 학습 중에 ID 및 OOD 샘플을 명시적으로 분리하기 위해 분포 수준의 감독형 대비 손실을 도입한다. 이는 분포 인식 능력을 향상시킨다.
- OOD 샘플을 대비 학습 파이프라인에 통합하며, 표준 데이터 증강 기법과 MoCo 스타일의 큐 메커니즘을 사용한다.
- 학습 중 특징 공간의 동적 균형을 유지하기 위해 정기적인 간격으로 재샘플링 메커니즘을 적용한다.
- 다단계 학습 파이프라인을 사용한다: (1) 테일니스 스코어링을 통한 특징 공간 분석, (2) 온라인 OOD 샘플링, (3) 분포 인식 손실을 적용한 대비 학습.
실험 결과
연구 질문
- RQ1내부 분포(ID) 데이터가 부족한 상황에서, 레이블이 없는 외부 분포(OOD) 데이터가 장수분포 데이터셋에서 비지도 학습 성능 향상에 효과적으로 기여할 수 있는가?
- RQ2OOD 샘플은 어떻게 선택하고 통합되어야 하며, 이를 통해 특징 공간이 동적으로 재균형화되어 소수 클래스(꼬리 클래스)에 유리하게 작용할 수 있는가?
- RQ3분포 인식형 대비 손실이 비지도 학습 중 ID 및 OOD 샘플을 구분하는 데 어떤 영향을 미치는가?
- RQ4외부 ID 데이터를 사용하는 최신 기법들과 비교해 COLT의 성능은 어떻게 되는가?
- RQ5재샘플링 간격 및 상위-k 샘플링과 같은 하이퍼파라미터 선택에 대해 이 방법은 어느 정도 강건한가?
주요 결과
- COLT는 레이블이 없는 내부 분포 데이터를 사용하지 않고도 다양한 SSL 프레임워크의 장수분포 데이터셋에서 성능을 크게 향상시켜 최신 기술 수준의 성능을 달성한다.
- CIFAR-100-LT에서 COLT는 표준 SSL 기반 모델 대비 선형 평가 정확도를 10퍼센트 이상 향상시키며, 외부 ID 데이터를 사용하는 기법들보다도 뛰어난 성능을 보였다.
- 시각화 및 메트릭 분석을 통해, 특히 꼬리 클래스에서 특징 공간의 균일성과 정렬성이 향상됨을 확인했다.
- 분포 인식형 대비 손실은 클래스 간 성능 변동성을 감소시켜 표준편차를 낮추고, 클래스 불균형 문제를 완화시켰다.
- OOD 샘플의 예산이 10,000~15,000개에 도달하면 성능 향상의 폭이 둔화되며, 이는 높은 데이터 효율성과 그 이상의 샘플은 수익 감소 효과를 보임을 시사한다.
- 동일한 OOD 데이터를 사용할 때, COLT는 FixMatch, FlexMatch 등의 준지도 학습 기반 모델들을 능가하며, 이는 SSL에 직접 통합하는 것이 의사 레이블링보다 더 효과적임을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.