Skip to main content
QUICK REVIEW

[논문 리뷰] Latent Embedding Feedback and Discriminative Features for Zero-Shot Classification

Sanath Narayan, Akshita Gupta|arXiv (Cornell University)|2020. 03. 17.
Domain Adaptation and Few-Shot Learning참고 문헌 48인용 수 33
한 줄 요약

이미지와 비디오의 (G)ZSL에 대해 학습, 합성, 분류 전반에 걸친 의미 일관성을 보장하기 위한 의미 임베딩 디코더와 피드백 루프를 갖춘 VAE-GAN 프레임워크인 TF-VAEGAN을 제안하여 다수 벤치마크에서 최첨단 성능을 달성한다.

ABSTRACT

Zero-shot learning strives to classify unseen categories for which no data is available during training. In the generalized variant, the test samples can further belong to seen or unseen categories. The state-of-the-art relies on Generative Adversarial Networks that synthesize unseen class features by leveraging class-specific semantic embeddings. During training, they generate semantically consistent features, but discard this constraint during feature synthesis and classification. We propose to enforce semantic consistency at all stages of (generalized) zero-shot learning: training, feature synthesis and classification. We first introduce a feedback loop, from a semantic embedding decoder, that iteratively refines the generated features during both the training and feature synthesis stages. The synthesized features together with their corresponding latent embeddings from the decoder are then transformed into discriminative features and utilized during classification to reduce ambiguities among categories. Experiments on (generalized) zero-shot object and action classification reveal the benefit of semantic consistency and iterative feedback, outperforming existing methods on six zero-shot learning benchmarks. Source code at https://github.com/akshitac8/tfvaegan.

연구 동기 및 목표

  • 학습, 합성, 분류 등 모든 단계에서 의미 일관성을 보장하여 제로샷 및 일반화 제로샷 분류를 향상시킨다.
  • 합성 및 분류 중 피드백을 제공하고 의미 임베딩을 재구성하기 위해 의미 임베딩 디코더(SED)를 활용한다.
  • VAE-GAN 프레임워크 내에서 합성 특징을 반복적으로 정제하기 위한 피드백 모듈을 도입한다.
  • SED 잠재 임베딩을 활용하여 분류 중 구분 가능한 특징 변환을 향상시킨다.
  • 이미지의 표준 ZSL/GZSL 벤치마크와 비디오에서의 제로샷 동작 인식에 대한 개선을 입증한다.

제안 방법

  • 조건부 생성기와 VAE 인코더를 사용하여 보이지 않는 클래스 특징을 합성하기 위해 f-VAEGAN 백본 위에 TF-VAEGAN을 구축한다.
  • 특징으로부터 임베딩을 재구성하고 훈련 중 임베딩에 대한 주기 일관성(L_R)을 강제하는 의미 임베딩 디코더(SED)를 도입한다.
  • 디코딩된 임베딩을 통해 생성기 층을 조절하여 특징 합성을 개선하는 피드백 모듈(F)을 추가한다(반복적 정제).
  • ZSL/GZSL 분류를 위해 시각 특징을 SED의 잠재 임베딩과 연결(concatenate)하여 판별적 특징 변환을 적용한다(f_zsl and f_gzsl).
  • L_total = L_vaegan + beta * L_R 이 되도록 학습하며, L_R은 임베딩-주기 일관성을 강제한다; G와 F의 교대 업데이트로 학습을 확장한다.
  • 일반화 제로샷 학습으로 프레임워크를 확장하고 이미지 데이터셋(CUB, FLO, SUN, AWA2)과 제로샷 동작 데이터셋(HMDB51, UCF101)에서 테스트한다.

실험 결과

연구 질문

  • RQ1(G)ZSL의 모든 단계에서 의미 일관성을 보장하여 합성 및 판별 성능을 개선할 수 있는가?
  • RQ2의미 임베딩 디코더가 생성 특징을 정제하는 데 유용한 피드백을 제공하여 ZSL/GZSL 성능을 향상시키는가?
  • RQ3SED 잠재 임베딩과 함께 구분 가능한 특징 변환을 도입하면 ZSL/GZSL에서 클래스 간 애매함이 감소하는가?
  • RQ4이 아이디어들이 비디오의 일반화 제로샷 동작 인식으로 확장 가능한가?
  • RQ5표준 벤치마크에서 제안된 TF-VAEGAN 구성요소들이 기본 f-VAEGAN 및 다른 GAN 기반 ZSL 방법들과 비교하여 어느 정도의 성능을 보이는가?

주요 결과

  • TF-VAEGAN은 네 가지 표준 ZSL/GZSL 데이터셋에서 귀납적 및 추측적 설정 모두에서 기본 f-VAEGAN보다 우수하다.
  • ZSL에서 TF-VAEGAN은 CUB, FLO, SUN 및 AWA에서 베이스라인 및 다수의 동시대 방법들보다 상위 1위 정확도를 달성한다.
  • GZSL에서 TF-VAEGAN은 조화평균 및 보이지 않는/보이는 정확도를 데이터셋 전반에 걸쳐 개선하며, 비표기 데이터 활용 가능한 추정 설정도 포함한다.
  • 소거 실험은 피드백과 T-특징 기여가 모두 기본값을 넘는 성능 향상을 보이며, TF-VAEGAN이 이를 결합하여 최상의 결과를 낳음을 보인다.
  • 제안된 구성요소의 일반화를 보여주며, TF-VAEGAN이 해당 프레임워크에 통합될 때 f-CLSWGAN보다도 향상된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.