Skip to main content
QUICK REVIEW

[논문 리뷰] The Semi-Supervised iNaturalist-Aves Challenge at FGVC7 Workshop

Jong-Chyi Su, Subhransu Maji|arXiv (Cornell University)|2021. 03. 11.
Domain Adaptation and Few-Shot Learning참고 문헌 16인용 수 14
한 줄 요약

이 논문은 1,000종의 새를 포함하고 있으며, 200개의 클래스 내 카테고리(3,959장의 레이블된 이미지)와 800개의 클래스 외 신규 카테고리(122,208장의 레이블되지 않은 이미지)를 갖춘, 정교한 시각 인식을 위한 준지도 학습 벤치마크인 Semi-Aves를 소개한다. 이는 클래스 불균형, 도메인 이동, 전이 학습 등의 실제 문제를 반영하도록 설계되었다. 최고의 방법으로는 테스트 세트에서 90.1%의 Top-1 정확도를 달성하였으며, 클래스 내 레이블되지 않은 데이터에 대한 가짜 레이블링이 가장 효과적인 것으로 나타났다. 반면, 클래스 외 데이터는 제한적인 도움을 제공하였다.

ABSTRACT

This document describes the details and the motivation behind a new dataset we collected for the semi-supervised recognition challenge~\cite{semi-aves} at the FGVC7 workshop at CVPR 2020. The dataset contains 1000 species of birds sampled from the iNat-2018 dataset for a total of nearly 150k images. From this collection, we sample a subset of classes and their labels, while adding the images from the remaining classes to the unlabeled set of images. The presence of out-of-domain data (novel classes), high class-imbalance, and fine-grained similarity between classes poses significant challenges for existing semi-supervised recognition techniques in the literature. The dataset is available here: \url{https://github.com/cvl-umass/semi-inat-2020}

연구 동기 및 목표

  • 실제 세계의 과제들인 클래스 불균형과 새로운 클래스를 반영하는 현실적인 준지도 학습(SSL) 벤치마크의 부족을 해결하기 위해.
  • 레이블된 데이터와 레이블되지 않은 데이터 사이의 도메인 이동을 포함한 현실 조건에서 SSL 방법의 평가가 가능한 데이터셋을 구축하기 위해.
  • ImageNet에서의 전이 학습이 정교한 시각 인식에서 SSL 성능에 어떤 영향을 미치는지 조사하기 위해.
  • FGVC7에서 도전 대회를 개최하여 현실적이고 대규모의 새 인식 데이터셋에서 최신 SSL 기법의 성능을 평가하기 위해.

제안 방법

  • 1,000종의 새가 포함된 iNaturalist-2018 데이터셋에서 선택된 자료를 바탕으로 데이터셋을 구성하였으며, 200종은 클래스 내로 지정되고 800종은 클래스 외로 지정되었다.
  • 레이블된 이미지(3,959장)는 200개의 클래스 내 새 종에서 수집되었으며, 각 클래스에 최소 5장의 이미지가 확보되었고, 나머지 26,640장의 클래스 내 이미지는 레이블되지 않은 클래스 내 데이터로 사용되었다.
  • 클래스 외 레이블되지 않은 데이터(122,208장의 이미지)는 추가로 800종의 새 종에서 수집되어 새로운 클래스를 시뮬레이션하고 도메인 이동을 유도하였다.
  • 검증 및 테스트 세트는 각 클래스당 10장과 40장의 이미지를 포함하도록 구성되어, 균일한 클래스 분포를 확보하였다.
  • 참가자들은 iNaturalist에서 미세조정된 모델를 사용하지 못하고, ImageNet-1k에서 미리 훈련된 모델만 사용하도록 허용하여 전이 학습의 영향을 분리하였다.
  • 도전 대회에서는 두 단계 테스트 분할을 사용하였으며, 50%는 랭킹 업데이트를 위한 공개 세트이고, 나머지 50%는 최종 순위 결정을 위한 비공개 세트였다.

실험 결과

연구 질문

  • RQ1레이블된 데이터와 레이블되지 않은 데이터 사이에 심각한 클래스 불균형과 도메인 이동이 존재하는 벤치마크에서 기존 준지도 학습 방법의 성능는 어떠한가?
  • RQ2ImageNet에서의 전이 학습은 정교한 시각 인식에서 성능 향상에 어느 정도 기여하는가?
  • RQ3클래스 외(신규) 레이블되지 않은 데이터를 통합하면 모델의 일반화 능력이 향상되는가, 아니면 도메인 이동으로 인해 성능 저하가 발생하는가?
  • RQ4정교한 카테고리가 있는 현실적인 SSL 환경에서 가장 효과적인 데이터 증강 및 앙상블 전략은 무엇인가?
  • RQ5최신 준지도 학습 방법인 MixMatch와 FixMatch가 이 설정에서 제한된 향상만 보이는 이유는 무엇인가?

주요 결과

  • 최고 성능을 낸 방법은 비공개 테스트 세트에서 90.1%의 Top-1 정확도를 달성하였으며, ImageNet에서 미세조정된 베이스라인 모델(43.3% Top-1)을 크게 앞서는 성능을 보였다.
  • 승리한 방법들에서 클래스 내 레이블되지 않은 데이터에 대한 가짜 레이블링 기법이 가장 효과적인 것으로 나타났으며, 이는 클래스 불균형 하에서 자기학습(self-training)의 강력한 활용 가능성을 시사한다.
  • 클래스 외 레이블되지 않은 데이터는 도메인 유사성에도 불구하고 제한적인 도움을 제공하여, 도메인 이동이 새로운 클래스에서의 지식 전이를 방해한다는 것을 시사한다.
  • 한 팀은 클래스 외 데이터를 기반으로 한 클러스터링 기반 사전 훈련이 ImageNet 사전 훈련만으로 하는 것보다 성능 향상을 이룬다고 보고하여, 도메인 일치에 대한 기존 가정을 도전하였다.
  • 풍부한 데이터 증강과 모델 앙상블 전략은 이 설정에서 복잡한 SSL 알고리즘인 MixMatch와 FixMatch를 뛰어넘는 효과적인 성능 향상을 보였다.
  • 오라클 모델(69.0% Top-1)과 최고 성능 모델(90.1% Top-1) 사이의 격차는 현실 세계의 준지도 학습 응용 분야에서 향상 여지가 여전히 크다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.