Skip to main content
QUICK REVIEW

[논문 리뷰] Semantics Disentangling for Generalized Zero-Shot Learning

Zhi Chen, Yadan Luo|arXiv (Cornell University)|2021. 01. 20.
Domain Adaptation and Few-Shot Learning참고 문헌 34인용 수 10
한 줄 요약

이 논문은 관계 모듈과 총 상관도 페널티를 갖춘 조건부 VAE를 사용하여 시각적 특징을 의미론적 일致성 있는 요소와 의미론적 관련성이 없는 요소로 분리하는 의미론적 분리 프레임워크인 SDGZSL을 제안한다. 특징을 애너테이션된 속성과 일치시키기 위해 분리함으로써 일반화된 제로샷 학습에서 일반화 성능을 향상시키며, 네 가지 벤치마크 데이터셋에서 최고 성능을 달성한다.

ABSTRACT

Generalized zero-shot learning (GZSL) aims to classify samples under the assumption that some classes are not observable during training. To bridge the gap between the seen and unseen classes, most GZSL methods attempt to associate the visual features of seen classes with attributes or to generate unseen samples directly. Nevertheless, the visual features used in the prior approaches do not necessarily encode semantically related information that the shared attributes refer to, which degrades the model generalization to unseen classes. To address this issue, in this paper, we propose a novel semantics disentangling framework for the generalized zero-shot learning task (SDGZSL), where the visual features of unseen classes are firstly estimated by a conditional VAE and then factorized into semantic-consistent and semantic-unrelated latent vectors. In particular, a total correlation penalty is applied to guarantee the independence between the two factorized representations, and the semantic consistency of which is measured by the derived relation network. Extensive experiments conducted on four GZSL benchmark datasets have evidenced that the semantic-consistent features disentangled by the proposed SDGZSL are more generalizable in tasks of canonical and generalized zero-shot learning. Our source code is available at https://github.com/uqzhichen/SDGZSL.

연구 동기 및 목표

  • 애너테이션된 속성과 의미론적으로 일치하지 않는 시각적 특징으로 인해 제로샷 학습 모델의 일반화 성능이 떨어지는 문제를 해결하기 위해.
  • 시각적 특징을 의미론적 일치성 있는 요소와 의미론적 관련성이 없는 요소로 분리하여 속성과의 일치도를 높이고, 볼 수 없는 클래스로의 전이 능력을 향상시키기 위해.
  • 기존의 사전 훈련된 CNN에서 유도된 뒤섞인 특징보다 더 나은 성능을 내기 위해, 분리된 표현을 활용하는 프레임워크를 개발하기 위해.

제안 방법

  • 조건부 변동형 자동차오더(이하 cVAE)를 사용하여 의미론적 일치성 있는 특징($\bm{h}_s$)과 의미론적 관련성이 없는 특징($\bm{h}_n$)이라는 두 개의 분리된 잠재 벡터로부터 시각적 특징을 재구성한다.
  • 관계 모듈은 $\bm{h}_s$와 의미론적 임베딩 간의 호환성 점수를 계산하여 $\bm{h}_s$가 의미론적 일관성 향향 학습을 유도한다.
  • 총 상관도 페널티를 적용하여 $\bm{h}_s$와 $\bm{h}_n$ 간의 통계적 독립성을 확보함으로써 분리도를 강화한다.
  • 재구성 손실은 $\bm{h}_s$와 $\bm{h}_n$의 합이 원래의 시각적 정보를 모두 유지하도록 보장한다.
  • 재구성, 관계, 분리 손실을 통합한 공동 목적함수를 사용해 모델을 엔드 투 엔드로 훈련한다.
  • 분리된 $\bm{h}_s$ 특징은 GZSL에서 분류에 사용되어 본 적 없는 클래스로의 전이 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1시각적 특징을 의미론적 일치성 있는 요소와 의미론적 관련성이 없는 요소로 분리하면 GZSL에서의 제로샷 일반화 성능이 향상되는가?
  • RQ2관계 모듈을 사용해 $\bm{h}_s$를 의미론적 속성과 일치시킬 경우 특징 품질과 모델 성능이 향상되는가?
  • RQ3총 상관도 페널티가 의미론적 일치성 있는 특징와 의미론적 관련성이 없는 특징 간의 독립성을 강제로 확보하는 데 얼마나 효과적인가?
  • RQ4기존의 사전 훈련된 CNN에서 유도된 뒤섞인 특징보다 분리된 $\bm{h}_s$ 특징이 GZSL에서 더 나은 일반화 성능을 보이는가?
  • RQ5관계 모듈, 총 상관도, 재구성 손실 등의 개별 구성 요소가 전체 성능에 미치는 영향은 어떠한가?

주요 결과

  • 제안된 SDGZSL 프레임워크는 CUB, AWA1, AWA2, FLOWERS 네 가지 GZSL 벤치마크 데이터셋에서 최고 성능을 달성한다.
  • 의미론적 일치성 있는 특징($\bm{h}_s$)은 원래의 뒤섞인 특징($\bm{h}$)과 의미론적 관련성이 없는 특징($\bm{h}_n$)보다 GZSL 정확도에서 뚜렷한 승리를 거두었다.
  • 제거 실험 결과, 관계 모듈과 총 상관도 페널티 모두 최적 성능을 내기 위해 필수적임을 확인하였으며, 두 요소를 함께 사용했을 때 가장 우수한 성능를 기록했다.
  • t-SNE 시각화 결과, $\bm{h}_s$ 특징은 $\bm{h}_n$ 특징보다 더 구분력 있고 클래스 간 분리가 잘 되어 있음을 확인하였으며, $\bm{h}_n$ 특징은 의미론적 요소나 속성과 관련 없는 패턴만 유지하고 있었다.
  • 모델는 잠재 차원, 관계 가중치, 총 상관도 가중치, 판별기 가중치 등의 하이퍼파라미터 변화에 대해 안정적인 성능를 보이며 강건성을 입증하였다.
  • 가장 가까운 이웃 검색 결과, $\bm{h}_s$ 특징이 정확한 클래스 예제를 더 효과적으로 검색하는 것으로 나타났으며, 주로 외관은 유사하지만 의미론적으로 다른 클래스에서 오해의 소지가 있는 결과가 발생하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.