Skip to main content
QUICK REVIEW

[논문 리뷰] Domain segmentation and adjustment for generalized zero-shot learning

Xinsheng Wang, Shanmin Pang|arXiv (Cornell University)|2020. 02. 01.
Domain Adaptation and Few-Shot Learning참고 문헌 39인용 수 6
한 줄 요약

이 논문은 생성 모델이나 미사용 의미 데이터에 의존하지 않는 일반화된 제로샷 학습(GZSL)을 위한 도메인 분할 및 조정 프레임워크를 제안한다. 소프트맥스 신뢰도 임계값과 극값 이론(EVT)을 조합하여 분포 분석을 수행함으로써, 테스트 샘플을 본 적 있는 도메인, 본 적 없는 도메인, 불확실한 도메인으로 분할하고, 불확실 영역의 예측을 보정하기 위해 校정된 스태킹(CS)을 적용한다. 이로 인해 생성 모델이나 미사용 클래스 정보를 사용하지 않고도 다섯 가지 벤치마크에서 새로운 최고 성능을 달성한다.

ABSTRACT

In the generalized zero-shot learning, synthesizing unseen data with generative models has been the most popular method to address the imbalance of training data between seen and unseen classes. However, this method requires that the unseen semantic information is available during the training stage, and training generative models is not trivial. Given that the generator of these models can only be trained with seen classes, we argue that synthesizing unseen data may not be an ideal approach for addressing the domain shift caused by the imbalance of the training data. In this paper, we propose to realize the generalized zero-shot recognition in different domains. Thus, unseen (seen) classes can avoid the effect of the seen (unseen) classes. In practice, we propose a threshold and probabilistic distribution joint method to segment the testing instances into seen, unseen and uncertain domains. Moreover, the uncertain domain is further adjusted to alleviate the domain shift. Extensive experiments on five benchmark datasets show that the proposed method exhibits competitive performance compared with that based on generative models.

연구 동기 및 목표

  • 생성 모델이나 미사용 의미 정보에 의존하지 않고, 일반화된 제로샷 학습(GZSL)에서 발생하는 도메인 이동 문제를 해결하기 위해.
  • 본 적 없는 의미 임베딩을 본 적 있는 클래스로만 훈련된 시각적 공간에 투영함으로써 유도되는 편향을 완화하기 위해.
  • 본 적 있는, 본 적 없는, 불확실한 샘플을 분리하는 강력하고 데이터 기반의 테스트 시점 도메인 분할 방법을 개발하기 위해.
  • 불확실 도메인에서 校정된 스탭킹(CS)을 사용하여 예측을 조정함으로써 일반화 성능을 향상시키기 위해.
  • 합성된 미사용 데이터와 CS의 효과를 실증적으로 비교하여, 생성 모델이 GZSL에 필수적이라는 가정을 도전하기 위해.

제안 방법

  • 본 적 있는 클래스에 대해 소프트맥스 분류기를 훈련하여 테스트 인스턴스의 신뢰도 점수를 확보한다.
  • 극값 이론(EVT)을 적용하여 각 본 적 있는 클래스의 시각적 특징 꼬리 분포를 모델링하고, 이질적(외부 분포) 샘플을 나타내는 극단적 값을 식별한다.
  • 소프트맥스 신뢰도와 EVT 기반 이상치 점수를 기반으로, 신뢰도와 분포 분석을 통합한 이중 임계값 및 확률 분포 방법을 통해 테스트 인스턴스를 세 도메인(본 적 있는, 본 적 없는, 불확실한)으로 분할한다.
  • 불확실 도메인 샘플에 대해, 본 적 있는 클래스와 본 적 없는 클래스의 프로토타입까지의 예측 거리를 균형 잡는 데 校정된 스탭킹(CS)을 적용한다.
  • 훈련 중에 미사용 클래스의 의미 벡터를 사용하지 않으며, ZSL의 가정을 유지한다. 즉, 미사용 클래스는 학습 중에 관찰되지 않는다.
  • 프레임워크는 미사용 클래스 데이터에 접근할 수 없는 다섯 가지 표준 GZSL 벤치마크에서 종단 간(end-to-end) 평가된다.

실험 결과

연구 질문

  • RQ1신뢰도와 분포 분석 기반의 도메인 분할이 GZSL에서 본 적 있는, 본 적 없는, 불확실한 테스트 샘플을 효과적으로 분리할 수 있는가?
  • RQ2교정된 스탭킹(CS)이 생성 모델의 효과를 뛰어넘거나 모방할 수 있는가?
  • RQ3생성 모델을 통해 합성된 미사용 데이터의 사용은 진정으로 GZSL에 유익한가, 아니면 의도치 않은 편향을 유도하는가?
  • RQ4생성 모델이나 미사용 의미 정보에 의존하는 최신 기법들과 비교해 볼 때, 제안된 방법은 어떻게 성능을 내는가?
  • RQ5간단한 비생성 기반 방법이 도메인 분할과 불확실성 조정에 집중함으로써 GZSL에서 최고 성능을 달성할 수 있는가?

주요 결과

  • 제안된 방법은 미사용 클래스 정보를 전혀 사용하지 않아도 다섯 가지 벤치마크 데이터셋(awa1, awa2, aPY, CUB, FLO)에서 새로운 최고 성능을 달성한다.
  • FLO 데이터셋에서, 이 방법은 평균 클래스별 상위 1위 정확도 61.8%를 기록했으며, 베이스라인(38.4%)과 f-CLSWGAN를 사용한 베이스라인(45.5%)을 크게 뛰어넘었다.
  • CS만으로도 FLO에서 61.8%의 정확도를 달성했으며, f-CLSWGAN로 생성된 데이터를 사용한 경우(45.5%)보다 뛰어나, 이는 이 설정에서 CS가 데이터 증강보다 더 효과적임을 시사한다.
  • 베이스라인 모델은 도메인 이동로 인해 본 적 없는 인스턴스의 37.4%를 본 적 있는 클래스로 잘못 예측했지만, 제안된 방법은 도메인 분할과 CS를 통해 이 오류를 크게 감소시켰다.
  • 예측 거리의 분포 분석 결과, CS는 불확실 영역에서 본 적 있는 클래스로의 편향을 효과적으로 줄여 일반화 성능을 향상시킨다.
  • 결과적으로 생성 모델이 GZSL에 이상적인 도구가 아닐 수 있음을 시사한다. 생성 모델의 생성기는 오직 본 적 있는 데이터로만 훈련되기 때문에 본 적 있는 클래스 인식을 악화시킬 수 있으며, 이는 CS가 보정하는 효과와 유사하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.