Skip to main content
QUICK REVIEW

[논문 리뷰] Distributional Robustness Loss for Long-tail Learning

Dvir Samuel, Gal Chechik|arXiv (Cornell University)|2021. 04. 07.
Domain Adaptation and Few-Shot Learning참고 문헌 42인용 수 4
한 줄 요약

이 논문은 장기 분포 데이터에서 표현 학습을 향상시키기 위해 클래스 중심점 주변의 불확실성 영역 내에서 최악의 위험을 최소화하는 분포로 보존 최적화 기반 손실인 DRO-LT 손실을 제안한다. 헤드 클래스에 대한 편향을 줄이면서도 헤드 클래스 정확도를 유지하는 강건한 표현을 학습함으로써, CIFAR100-LT, ImageNet-LT, iNaturalist 벤치마크에서 새로운 최고 성능을 달성하며 꼬리 클래스 인식에서 뚜렷한 향상을 이룬다.

ABSTRACT

Real-world data is often unbalanced and long-tailed, but deep models struggle to recognize rare classes in the presence of frequent classes. To address unbalanced data, most studies try balancing the data, the loss, or the classifier to reduce classification bias towards head classes. Far less attention has been given to the latent representations learned with unbalanced data. We show that the feature extractor part of deep networks suffers greatly from this bias. We propose a new loss based on robustness theory, which encourages the model to learn high-quality representations for both head and tail classes. While the general form of the robustness loss may be hard to compute, we further derive an easy-to-compute upper bound that can be minimized efficiently. This procedure reduces representation bias towards head classes in the feature space and achieves new SOTA results on CIFAR100-LT, ImageNet-LT, and iNaturalist long-tail benchmarks. We find that training with robustness increases recognition accuracy of tail classes while largely maintaining the accuracy of head classes. The new robustness loss can be combined with various classifier balancing techniques and can be applied to representations at several layers of the deep model.

연구 동기 및 목표

  • 장기 분포 데이터에서 훈련된 딥 모델에서의 표현 편향 문제, 특히 특징 추출기(백본) 레이어에서의 미처 다루어지지 않은 문제를 해결하기 위해.
  • 분류기 재가중 이외의 표현 품질 향상이 장기 분포 벤치마크에서 인식 성능을 크게 향상시킬 수 있는지 조사하기 위해.
  • 꼬리 클래스 표현의 불확실성(적은 샘플로 인한)을 고려한 강건한 최적화 기반 손실을 개발하기 위해.
  • 표준 분류 손실과 함께 공동 최적화가 가능한 효율적이고 미분 가능한 분포로 보존 손실의 상한을 유도하기 위해.
  • 강건한 표현 학습이 헤드 클래스 성능을 저하시키지 않으면서 꼬리 클래스 정확도를 향상시킬 수 있는지 입증하기 위해.

제안 방법

  • 장기 분포 학습을 분포로 보존 최적화(DRO) 문제로 공식화하여, 모델이 클래스 중심점 주변의 불확실성 이웃 영역 내에서 최악의 분포에 대해 강건해지도록 훈련한다.
  • 각 클래스 중심점 주변의 불확실성 영역을 반지름 ε인 구로 정의하며, 소수의 샘플로 인해 분산이 더 높은 꼬리 클래스에 대해 더 큰 반지름을 할당한다.
  • 분포로 보존 손실의 해석 가능하고 미분 가능한 상한을 도출하여 기울기 하강을 통한 효율적 최적화를 가능하게 한다.
  • 각 클래스별로 학습 중에 공동 최적화되는 가속도 안전거리 ε를 도입하여 수동적인 하이퍼파라미터 튜닝을 방지한다.
  • DRO-LT 손실을 표준 크로스 엔트로피 손실과 결합하여 표현 학습과 분류기 헤드 튜닝을 함께 최적화할 수 있도록 한다.
  • 네트워크의 여러 레이어에서 표현에 적용하며, 추론 분석 결과에서 펜ultimate 레이어에서 가장 높은 성능 향상을 보였다.
Figure 1: Our distributional robustness loss is designed for learning a representation where samples are kept close to the centroid of their class. Here, the empirical centroid $\widehat{\mu_{2}}$ (framed pink triangle) is estimated based only on few samples (four pink triangles) and as a result it
Figure 1: Our distributional robustness loss is designed for learning a representation where samples are kept close to the centroid of their class. Here, the empirical centroid $\widehat{\mu_{2}}$ (framed pink triangle) is estimated based only on few samples (four pink triangles) and as a result it

실험 결과

연구 질문

  • RQ1장기 분포 데이터에서 훈련된 딥 네트워크의 표현 학습은 초기 레이어에서도 헤드 클래스에 대한 편향을 보이나?
  • RQ2분포로 보존 최적화는 장기 분포 학습에서 헤드 클래스와 꼬리 클래스 양쪽의 표현 품질 향상에 기여할 수 있는가?
  • RQ3효율적이고 미분 가능한 DRO 손실 상한을 도출할 수 있는가? 이는 엔드 투 엔드 학습을 가능하게 하는가?
  • RQ4추가적인 하이퍼파라미터 튜닝 없이 클래스별로 강건성 마진 ε를 공동으로 학습시킬 수 있는가?
  • RQ5표현의 강건성 향상이 헤드 클래스 성능을 저하시키지 않으면서 꼬리 클래스 정확도 향상에 기여하는가?

주요 결과

  • 딥 네트워크의 특징 추출기에서는 초기 레이어에서도 헤드 클래스에 대한 심각한 편향을 보이며, 모든 레이어에서 헤드 클래스와 꼬리 클래스 간의 정확도 격차가 지속된다.
  • 그림 4에서 보듯이, 제안된 DRO-LT 손실은 꼬리 클래스의 일반화 오차 간격을 줄이며, 헤드 클래스 성능을 유지한다.
  • 그림 5의 t-SNE 시각화 결과는 DRO-LT가 헤드 클래스와 꼬리 클래스 양쪽 모두에 대해 더 조밀하고 잘 분리된 특징 클러스터를 생성함을 확인한다.
  • 불균형 비율 50인 CIFAR100-LT에서 DRO-LT는 새로운 최고 성능을 달성하며, 헤드 정확도를 희생시키지 않고 꼬리 클래스 정확도를 크게 향상시킨다.
  • 꼬리 클래스에 대해 더 큰 강건성 마진(ε)을 학습하는 것으로, 그들의 표현에서 더 높은 불확실성을 반영한다.
  • CIFAR100-LT, ImageNet-LT, iNaturalist 세 가지 벤치마크에서 일관된 최고 성능을 기록하여 광범위한 적용 가능성을 입증한다.
Figure 2: Learned $\varepsilon$ values for each class of a ResNet-32 trained on CIFAR100-LT with imbalance ratio 50. Blue: Polynomial fit.
Figure 2: Learned $\varepsilon$ values for each class of a ResNet-32 trained on CIFAR100-LT with imbalance ratio 50. Blue: Polynomial fit.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.