Skip to main content
QUICK REVIEW

[논문 리뷰] Nested Collaborative Learning for Long-Tailed Visual Recognition

Jun Li, Zichang Tan|arXiv (Cornell University)|2022. 03. 29.
Domain Adaptation and Few-Shot Learning인용 수 10
한 줄 요약

이 논문은 장수분포 시각 인식을 위한 Nested Collaborative Learning(NCL)을 제안한다. NCL는 복수의 전문가를 중첩된 개별 학습(NIL)과 중첩된 균형 임의의 디스틸레이션(NBOD)을 통해 협업적으로 훈련시켜 모델의 강건성을 향상시킨다. 하드 카테고리 마이닝(HCM)을 통해 어려운 분류 대상 카테고리에 집중하면서 전체 및 부분 시점 학습을 동시에 최적화하고, 자기지도 학습을 통합함으로써 예측 불확실성을 감소시키며, 최신 기술 수준의 성능을 달성한다. 이는 장수분포 벤치마크에서 단일 모델 및 앙상블보다 뛰어난 성능을 보인다.

ABSTRACT

The networks trained on the long-tailed dataset vary remarkably, despite the same training settings, which shows the great uncertainty in long-tailed learning. To alleviate the uncertainty, we propose a Nested Collaborative Learning (NCL), which tackles the problem by collaboratively learning multiple experts together. NCL consists of two core components, namely Nested Individual Learning (NIL) and Nested Balanced Online Distillation (NBOD), which focus on the individual supervised learning for each single expert and the knowledge transferring among multiple experts, respectively. To learn representations more thoroughly, both NIL and NBOD are formulated in a nested way, in which the learning is conducted on not just all categories from a full perspective but some hard categories from a partial perspective. Regarding the learning in the partial perspective, we specifically select the negative categories with high predicted scores as the hard categories by using a proposed Hard Category Mining (HCM). In the NCL, the learning from two perspectives is nested, highly related and complementary, and helps the network to capture not only global and robust features but also meticulous distinguishing ability. Moreover, self-supervision is further utilized for feature enhancement. Extensive experiments manifest the superiority of our method with outperforming the state-of-the-art whether by using a single model or an ensemble.

연구 동기 및 목표

  • 장수분포 데이터셋에서 훈련된 딥 러닝 모델에서 관찰되는 높은 예측 불확실성을 해결한다. 동일한 훈련 설정에서도 예측 결과가 크게 다를 수 있다.
  • 복수의 전문가 간 지식 협업을 통해 예측의 일관성을 높이고, 특히 꼬리 클래스에서의 불일관성을 줄인다.
  • 전체 시점(글로벌 뷰)과 부분 시점(하드 카테고리 특화 뷰)에서 동시에 최적화함으로써 표현 학습을 향상시킨다.
  • 자기지도 학습과 균형 임의의 디스틸레이션을 통합한 중첩 학습 프레임워크를 통해 모델의 강건성과 공정성을 향상시킨다.
  • 앙성 모델 수준의 성능를 달성하면서도 단일 전문가 추론 효율성을 유지한다.

제안 방법

  • 복수의 전문가를 협업적으로 훈련시켜 각 전문가가 동시에 강사와 학습자 역할을 할 수 있도록 하는 Nested Collaborative Learning(NCL) 프레임워크를 제안한다.
  • 모든 카테고리(전체 시점)와 하드 카테고리(부분 시점)에서의 지도 학습을 수행하는 Nested Individual Learning(NIL)을 도입하며, 하드 카테고리는 Hard Category Mining(HCM)을 통해 식별된다.
  • 전체 카테고리와 하드 카테고리 모두에 대해 균형 임의의 확률 디스틸레이션을 적용하는 지식 디스틸레이션 메커니즘인 Nested Balanced Online Distillation(NBOD)을 설계하여 일반화 성능 향상과 불확실성 감소를 도모한다.
  • 예측 확률이 높지만 진짜 레이블이 아닌 음성 카테고리(하드 음성)를 식별하기 위해 Hard Category Mining(HCM)을 구현하며, 이를 집중 학습 대상으로 삼는다.
  • 각 전문가별로 이동 평균 모델을 도입하여 자기지도 학습을 통해 특징 학습을 비지도 방식으로 향상시킨다.
  • NIL과 NBOD를 중첩 구조로 설계하여 전체 시점과 부분 시점 학습이 상호 보완적이고 상호의존적인 관계를 형성한다.

실험 결과

연구 질문

  • RQ1장수분포 데이터셋에서 훈련된 모델에서 관찰되는 예측 불확실성을 복수의 전문가 간 협업 학습이 줄일 수 있는가?
  • RQ2부분 시점에서 하드 카테고리에 집중함으로써 모델의 일반화 능력과 꼬리 클래스 정확도는 어떻게 향상되는가?
  • RQ3동시에 전체 시점과 부분 시점을 최적화하는 중첩 학습은 기존 훈련 방식에 비해 표현 학습을 얼마나 향상시키는가?
  • RQ4장수분포 환경에서 온라인, 균형 임의의 디스틸레이션은 오프라인 디스틸레이션 또는 표준 지식 디스틸레이션보다 성능이 뛰어나다고 할 수 있는가?
  • RQ5NCL로 훈련된 단일 전문가가 앙상블 수준의 성능를 달성하면서도 추론 효율성을 유지할 수 있는가?

주요 결과

  • 불균형 요인 100인 CIFAR100-LT에서 NCL는 단일 전문가로 51.04%의 정확도를 기록했고, 앙성 모델로는 54.42%를 달성하여 최신 기술 수준의 방법들을 초월한다.
  • NCL 적용 후 모델 예측 간 KL 발산이 크게 감소하여 불확실성이 감소하고 예측이 더 일관성이 있음을 확인하였다.
  • Hard Category Mining(HCM)은 고확률 음성 카테고리를 효과적으로 식별하며, 이를 집중적으로 학습함으로써 기준 방법 대비 1.5%의 성능 향상을 이룬다.
  • 균형 임의의 확률 디스틸레이션을 적용한 NBOD는 비균형 디스틸레이션 대비 약 1%의 성능 향상을 보이며, 장수분포 학습에서 확률 캘리브레이션의 중요성을 입증한다.
  • 온라인 디스틸레이션을 통한 NBOD는 오프라인 디스틸레이션 대비 1.5% 높은 성능를 기록하여 지속적인 협업 학습이 정적 지식 전이보다 더 효과적임을 보였다.
  • 자기지도 학습은 특징 향상에 기여하며, 추론 실험을 통해 전반적인 정확도와 강건성 향상에 긍정적인 영향을 미침을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.