Skip to main content
QUICK REVIEW

[논문 리뷰] The Semi-Supervised iNaturalist Challenge at the FGVC8 Workshop

Jong-Chyi Su, Subhransu Maji|arXiv (Cornell University)|2021. 06. 02.
Genomics and Phylogenetic Studies참고 문헌 4인용 수 12
한 줄 요약

이 논문은 3개의 생물계(Animalia, Plantae, Fungi)를 아우르는 세분화된, 긴 꼬리 분포를 가진 이미지 분류를 위한 대규모, 반감독 기반 테스트 벤치마크인 Semi-iNat을 소개한다. 이 데이터셋은 총 33만张의 이미지와 2,439개의 종을 포함하며, 레이블이 없는 데이터에 대해 고급 분류학적 레이블(계/강)만을 사용하여 자기지도 학습 방법을 평가한다. ImageNet에서의 사전 훈련은 초기 훈련 대비 상위 1위 정확도를 22% 향상시키며, 기준 모델에 비해 향상 여력이 크다는 것을 보여준다.

ABSTRACT

Semi-iNat is a challenging dataset for semi-supervised classification with a long-tailed distribution of classes, fine-grained categories, and domain shifts between labeled and unlabeled data. This dataset is behind the second iteration of the semi-supervised recognition challenge to be held at the FGVC8 workshop at CVPR 2021. Different from the previous one, this dataset (i) includes images of species from different kingdoms in the natural taxonomy, (ii) is at a larger scale -- with 810 in-class and 1629 out-of-class species for a total of 330k images, and (iii) does not provide in/out-of-class labels, but provides coarse taxonomic labels (kingdom and phylum) for the unlabeled images. This document describes baseline results and the details of the dataset which is available here: \url{https://github.com/cvl-umass/semi-inat-2021}.

연구 동기 및 목표

  • 세분화된, 긴 꼬리 분포, 도메인 이동 조건을 고려한 반감독 학습을 위한 현실적인 대규모 기반 테스트 벤치마크 부족 문제를 해결하기 위해.
  • 이전의 Semi-Aves 기반 테스트 벤치마크를 확장하여 세 종류의 생물계(Animalia, Plantae, Fungi)의 종을 포함함으로써 규모와 다양성을 증가시키기 위해.
  • 레이블이 없는 데이터에 대해 고급 분류학적 레이블(계/강)만 제공되는 현실적인 조건에서 반감독 학습 방법을 평가하기 위해.
  • 이전 기반 테스트 벤치마크에서 관찰된 도메인 이동 및 전이 학습의 한계를 테스트하는 새로운 과제를 FGVC8 2021에서 제공하기 위해.
  • 쉽게 확보할 수 있는 고급 레이블을 활용하여 분류 성능을 향상시키는 약한 감독, 반감독 기반 방법에 대한 연구를 가능하게 하기 위해.

제안 방법

  • 데이터셋은 iNaturalist 이미지에서 유래되었으며, 이전 iNaturalist 및 Semi-Aves 도전 대회에서 사용된 종들을 제외하여 겹침을 방지한다.
  • 분류학적 계층 구조에 따라 종들을 내부 종 집합(C_in)과 외부 종 집합(C_out)으로 분할하며, 각 강의 약 1/3의 종이 C_in에 할당된다.
  • C_in 종에 대해서는 5/10/10장의 이미지를 검증용, 공개 테스트용, 비공개 테스트용으로 확보하고, 나머지 이미지는 레이블이 있는(L_in) 및 레이블이 없는(U_in) 집합으로 나누며, 각 클래스당 최소 5장의 레이블 이미지가 확보된다.
  • 모든 C_out 이미지는 레이블이 없는 집합 U_out에 포함되며, U_in과 U_out이 결합되어 도메인 레이블이 제공되지 않는 단일 레이블이 없는 집합 U로 통합된다.
  • 모든 레이블이 없는 이미지에 대해 고급 분류학적 레이블(계 및 강)을 제공하여 약한 지도 신호를 제공한다.
  • 기준 모델은 SGD와 코즈라인 학습률 감소를 사용한 ResNet-50를 사용하여 훈련되며, 레이블이 있는 데이터만을 사용하여 상위 1위 및 상위 5위 정확도로 평가된다(기준). 또한 U_in의 진정한 레이블을 사용한 오라클 모델로도 평가된다.

실험 결과

연구 질문

  • RQ1기존의 반감독 학습 방법들은 세 종류의 생물계를 아우르는 대규모, 긴 꼬리 분포, 세분화된 분류를 위한 데이터셋에서 어떻게 성능을 발휘하는가?
  • RQ2세분화된 레이블이 없는 레이블이 없는 데이터에 대해 고급 분류학적 레이블(계 및 강)을 얼마나 활용할 수 있을까? 즉, 이는 반감독 학습 성능 향상에 얼마나 기여하는가?
  • RQ3이 어려운 환경에서 ImageNet 사전 훈련된 가중치로 훈련된 모델과 초기 훈련된 모델 간의 성능 비교는 어떻게 되는가?
  • RQ4레이블이 있는 데이터와 레이블이 없는 데이터 사이의 도메인 이동이 발생할 경우, 레이블이 없는 데이터셋에 다른 강과 계의 외부 종이 포함될 경우 성능에 어떤 영향을 미치는가?
  • RQ5모델의 혼동 패atters는 각 강에 따라 어떻게 달라지며, 이는 긴 꼬리 분포 및 도메인 이동 조건에서의 세분화된 분류의 어려움을 어떻게 드러내는가?

주요 결과

  • ImageNet 사전 훈련은 초기 훈련 대비 상위 1위 정확도를 22% 향상시키며, 이 환경에서 사전 훈련의 가치를 입증한다.
  • 기준 모델은 레이블이 있는 데이터만으로 훈련했을 때 상위 1위 정확도가 41.0%에 그쳐, 향후 반감독 학습 기법의 향상 여력이 크다는 것을 시사한다.
  • 오라클 모델(모든 가용 레이블 L_in ∪ U_in 사용)은 상위 1위 정확도 94.3%를 달성하여 현재 방법과 이론적 최상한 성능 간의 격차가 크다는 점을 보여준다.
  • 혼동 행렬 분석 결과, 종 수가 적은 강에서의 정확도가 낮고, 같은 계 내에서의 혼동 빈도가 더 높은 것으로 나타나, 동일 계 내 오분류가 주요 과제임을 시사한다.
  • 레이블이 있는 훈련 세트와 레이블이 없는 훈련 세트 양쪽 모두에서 긴 꼬리 분포가 관찰되며, 클래스당 이미지 수가 5~400장으로 변동하여 강력한 표현 학습의 어려움을 증가시킨다.
  • Animalia, Plantae, Fungi 세 생물계와 8개의 강을 포함함으로써 데이터셋의 다양성과 현실성이 향상되어 이전의 반감독 기반 테스트 벤치마크보다 더 도전적인 기준이 되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.