Skip to main content
QUICK REVIEW

[논문 리뷰] Solving Long-tailed Recognition with Deep Realistic Taxonomic Classifier

Tz-Ying Wu, Pedro Morgado|arXiv (Cornell University)|2020. 07. 20.
Domain Adaptation and Few-Shot Learning참고 문헌 42인용 수 4
한 줄 요약

이 논문은 장기적 분포에서 불확실성이 높을 경우 더 넓은 수준의 예측으로 세분화된 분류를 거부할 수 있도록 허용함으로써 장기적 인식 성능을 향상시키는 딥러닝 기반의 현실적인 분류기인 Deep-RTC를 제안한다. 학습 중 스토하스틱 트리 샘플링을 사용하고, 다중 수준의 종료 결정을 갖는 동적 추론을 통해 Deep-RTC는 장기적 데이터셋에서 최신 기술 성능을 달성하며, 정확히 예측된 비트 수(CPB) 기준으로 이전 방법보다 최대 11% 향상된다.

ABSTRACT

Long-tail recognition tackles the natural non-uniformly distributed data in real-world scenarios. While modern classifiers perform well on populated classes, its performance degrades significantly on tail classes. Humans, however, are less affected by this since, when confronted with uncertain examples, they simply opt to provide coarser predictions. Motivated by this, a deep realistic taxonomic classifier (Deep-RTC) is proposed as a new solution to the long-tail problem, combining realism with hierarchical predictions. The model has the option to reject classifying samples at different levels of the taxonomy, once it cannot guarantee the desired performance. Deep-RTC is implemented with a stochastic tree sampling during training to simulate all possible classification conditions at finer or coarser levels and a rejection mechanism at inference time. Experiments on the long-tailed version of four datasets, CIFAR100, AWA2, Imagenet, and iNaturalist, demonstrate that the proposed approach preserves more information on all classes with different popularity levels. Deep-RTC also outperforms the state-of-the-art methods in longtailed recognition, hierarchical classification, and learning with rejection literature using the proposed correctly predicted bits (CPB) metric.

연구 동기 및 목표

  • 장기적 데이터 분포에서 희귀(꼬리) 클래스에서 딥러닝 모델의 성능 저하 문제를 해결한다.
  • 모든 예측을 최소한의 분류 수준에서 강제로 수행하는 평면형 분류기의 한계를 극복한다.
  • 세분화된 분류가 불확실할 경우 더 넓은 수준의 더 신뢰할 수 있는 예측을 내릴 수 있도록 인간의 인지 방식을 모방한다.
  • 계층적 분류에서 정보 복구를 더 잘 반영하기 위해 새로운 평가 지표인 정확히 예측된 비트 수(CPB)를 도입한다.
  • 다양한 수준의 계층적 트리에서 동적 예측을 가능하게 하되, 높은 신뢰도를 유지하는 학습 및 추론 프레임워크를 개발한다.

제안 방법

  • 학습 중 계층적 구조에 대해 드롭아웃과 유사하게 모든 가능한 트리 컷을 시뮬레이션할 수 있도록 스토하스틱 트리 샘플링(_STS) 정규화 기법을 제안한다.
  • 모든 노드에서 예측을 생성할 수 있는 동적 소프트맥스 분류기를 구현한다. 이는 반드시 잎 노드에서만 예측을 내는 것과는 다르다.
  • 추론 시 신뢰도가 임계값 이하로 떨어지면 중간 노드에서 트리를 종료할 수 있도록 거부 메커니즘을 도입한다.
  • 각 계층 수준에서 보정된 확률 추정치를 생성하도록 모델을 훈련시켜, 어느 수준에서 종료할지를 신뢰할 수 있는 결정을 내릴 수 있도록 한다.
  • 다중 수준의 예측과 클래스 간 지식 전이를 지원하는 레이블 인코딩 및 계층적 손실 함수를 통합한다.
  • 모델을 훈련할 때 CPB 지표를 최적화하여, 엄격한 잎 노드 정확도보다는 정확한 정보 복구를 우선시한다.

실험 결과

연구 질문

  • RQ1세분화된 예측을 허용하는 계층적 분류기가 기존의 평면형 분류기보다 장기적 인식 성능을 향상시키는가?
  • RQ2계층적 트리의 중간 수준에서의 동적 종료는 다양한 클래스 인기 수준에서 정보 복구와 예측 신뢰도에 어떤 영향을 미치는가?
  • RQ3학습 중 스토하스틱 트리 샘플링을 통해 일반화 및 강건성 향상이 얼마나 향상되는가?
  • RQ4CPB를 통해 부분 예측의 정확성을 우선시하는 모델이 장기적 인식에서 최신 기술의 평면형 및 계층적 방법을 초월하는가?
  • RQ5동적이고 신뢰도 인식 가능한 분류기가 소수의 샘플을 가진 클래스에서의 성능 저하를 줄일 수 있는가, 동시에 다수의 샘플을 가진 클래스의 정확도를 유지할 수 있는가?

주요 결과

  • iNaturalist-LT에서 Deep-RTC는 최신 기술의 평면형 분류기 대비 CPB에서 9% 향상되었고, ImageNet-LT에서는 11% 향상되었다.
  • CIFAR100-LT, AWA2-LT, ImageNet-LT, iNaturalist-LT의 네 가지 데이터셋에서 모두 Deep-RTC는 모든 클래스 인기 수준에서 높은 성능을 유지하며, 이는 이전 방법들이 다수 샘플 클래스에서 성능 저하를 보이는 것과 대비된다.
  • 소수 샘플 클래스에서 Deep-RTC는 약 50%의 거부율을 기록했고, 거부된 예측에 대해 90% 이상의 계층적 정확도를 확보하여 더 넓은 수준의 예측에 대해 매우 높은 신뢰도를 보였다.
  • 특히 소수 및 중간 수의 샘플 클래스에서, Deep-RTC는 상태 기술의 평면형 현실 예측기(RP)보다 모든 거부율 설정에서 슈퍼리어한 성능을 보였다. 이는 중간 노드에서 소프트 거부가 가능하기 때문이다.
  • 복잡한 분기 구조를 추가한 경쟁 방법들보다 더 단순한 아키텍처를 사용했음에도 불구하고, Deep-RTC는 계층적 분류 벤치마크에서 뛰어난 성능을 기록했다.
  • CPB 지표는 Deep-RTC가 희귀 클래스에서 잘못된 잎 노드 예측을 피하고 정확한 중간 수준의 예측을 우선시함으로써, 이전 접근 방식보다 더 많은 정보를 샘플당 복구하고 있음을 드러냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.