Skip to main content
QUICK REVIEW

[논문 리뷰] Cross-modal Hallucination for Few-shot Fine-grained Recognition

Frederik Pahde, Patrick Jähnichen|arXiv (Cornell University)|2018. 06. 13.
Domain Adaptation and Few-Shot Learning참고 문헌 26인용 수 16
한 줄 요약

이 논문은 텍스트 기반 기술서술에서 클래스 구분 특징을 가진 이미지를 생성하는 구분형 텍스트 조건 GAN을 사용하여 소수의 샘플로 이루어진 세분화된 이미지 인식을 위한 교차 모odal 환각 프레임워크를 제안한다. 다중 모달 훈련 데이터(이미지 및 텍스트)를 활용하고, 클래스 구분 특징을 가진 판별자와 함께 자기 스피드 전략을 적용함으로써, 단일 모달 기반 보다 CUB 데이터셋에서 소수의 샘플로 학습할 경우 정확도를 4.9~8.6%p 향상시킨다.

ABSTRACT

State-of-the-art deep learning algorithms generally require large amounts of data for model training. Lack thereof can severely deteriorate the performance, particularly in scenarios with fine-grained boundaries between categories. To this end, we propose a multimodal approach that facilitates bridging the information gap by means of meaningful joint embeddings. Specifically, we present a benchmark that is multimodal during training (i.e. images and texts) and single-modal in testing time (i.e. images), with the associated task to utilize multimodal data in base classes (with many samples), to learn explicit visual classifiers for novel classes (with few samples). Next, we propose a framework built upon the idea of cross-modal data hallucination. In this regard, we introduce a discriminative text-conditional GAN for sample generation with a simple self-paced strategy for sample selection. We show the results of our proposed discriminative hallucinated method for 1-, 2-, and 5- shot learning on the CUB dataset, where the accuracy is improved by employing multimodal data.

연구 동기 및 목표

  • 세분화된 시각적 인식에서 훈련 데이터가 부족한 문제, 특히 새로운 클래스당 1~5개의 샘플만 존재하는 소수의 샘플 시나리오에서의 과제를 해결하기 위해.
  • 기본 클래스와 새로운 클래스 사이의 정보 격차를 다중 모달 데이터(이미지 및 세분화된 텍스트 기술서술)를 활용하여 훈련 중에 메우기 위해.
  • 실제 이미지가 부족한 상황에서도 텍스트 기반 기술서술에 조건화된 고품질의 클래스 구분 특징을 가진 이미지를 생성함으로써 소수의 샘플 학습 성능을 향상시키기 위해.
  • 생성된 이미지의 클래스 구분 특징 품질에 따라 우선순위를 정하는 자기 스피드 샘플 선택 전략을 개발하기 위해.
  • 훈련 시에는 다중 모달이지만 테스트 시에는 단일 모달(이미지만)인 새로운 다중 모달 소수의 샘플 학습 벤치마크를 설정하기 위해.

제안 방법

  • 생성자는 텍스트 기반 기술서술에 조건화된 이미지를 생성하도록 훈련된 구분형 텍스트 조건 GAN(tcGAN)을 사용하며, 생성자는 현실적이면서도 클래스를 구분할 수 있는 특징을 가진 샘플을 학습한다.
  • 판별자는 실재 대 가짜 판별 외에도 클래스를 구분할 수 있도록 수정된 D*로 변경되어, 새로운 클래스의 특징을 잘 반영한 생성된 샘플을 더 잘 선택할 수 있도록 한다.
  • 자기 스피드 학습 전략은 D*의 신뢰도 점수에 기반해 생성된 샘플을 순위 매기며, 가장 클래스를 구분할 수 있는 특징을 가진 이미지만을 훈련에 사용한다.
  • 최종 분류기는 실제 소수의 샘플 이미지와 상위 순위의 환각된 이미지의 조합으로 훈련되어, 데이터가 적은 환경에서의 일반화 성능을 향상시킨다.
  • 프레임워크는 사전 훈련된 텍스트 인코더를 사용해 텍스트 기술서술을 임bedding하고, 훈련 중에 대비 학습을 통해 시각적 특징과 정렬한다.
  • 실험은 기초 클래스 150개와 새로운 클래스 50개를 포함하는 CUB-200-2011 데이터셋에서 수행되었으며, 새로운 클래스당 1~20샷을 사용한다.

실험 결과

연구 질문

  • RQ1텍스트 조건 GAN을 사용한 교차 모달 환각이 단일 모달 기반 보다 소수의 샘플로 이루어진 세분화된 이미지 인식 성능을 향상시키는가?
  • RQ2생성된 샘플 선택에 구분형 판별자(D*)를 사용할 경우, 표준 실재 대 가짜 판별자보다 일반화 성능이 향상되는가?
  • RQ3이미지와 텍스트를 포함한 다중 모달 데이터가 소수의 샘플 학습에서 새로운 클래스의 실제 이미지가 부족할 경우 얼마나 효과적으로 보완되는가?
  • RQ4클래스 구분 특징 점수에 기반한 환각된 샘플 선택 전략이 모델의 강건성 향상에 얼마나 효과적인가?
  • RQ5이러한 프레임워크는 오직 이미지 데이터에 의존하거나 제로샷 생성에 의존하는 기존의 소수의 샘플 학습 방법보다 성능이 뛰어나게 되는가?

주요 결과

  • 제안된 방법(StGD*)은 1샷 학습에서 28.5%의 상위 5개 정확도를 기록하여 단일 모달 기반 보다 8.6%p 높은 성능을 보였다.
  • 2샷 학습에서는 31.6%의 상위 5개 정확도를 기록하여 기반 모델(24.8%) 대비 6.8%p 향상되었다.
  • 5샷 학습에서는 41.7%의 상위 5개 정확도를 기록하여 기반 모델(36.8%) 대비 4.9%p 향상되었다.
  • 클래스 구분 특징을 가진 판별자(D*)를 사용함으로써 표준 실재 대 가짜 판별자(StGD)를 사용한 경우보다 성능 향상이 뚜렷하게 향상되었다.
  • 정성적 분석 결과, D*에 의해 높은 순위로 평가된 이미지들은 더 많은 클래스 구분 특징을 포함한 반면, D만으로 평가된 이미지는 현실적이지만 종류가 혼합된 경우가 많았다.
  • 결과적으로 다중 모달 데이터와 구분형 샘플 선택 전략이 소수의 샘플로 이루어진 세분화된 인식에서 정보 격차를 메우는 데 핵심적임을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.