Skip to main content
QUICK REVIEW

[논문 리뷰] Information Bottleneck Constrained Latent Bidirectional Embedding for Zero-Shot Learning

Yang Liu, Lei Zhou|arXiv (Cornell University)|2020. 09. 16.
Domain Adaptation and Few-Shot Learning참고 문헌 77인용 수 5
한 줄 요약

이 논문은 정보 버블링 제약을 통한 이중성 생성 모델을 제안하여 제로샷 러닝에서 시각적 및 의미적 임베딩을 통합된 잠재 공간에서 공동 최적화함으로써 캘리브레이션 편차와 허브니스를 감소시키고 핵심 속성 정보를 유지한다. 이는 불확실성 추정과 웨이크-슬립 훈련을 활용하여 노이즈를 완화하고 추상화 능력을 향상시켜 여러 벤치마크에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Zero-shot learning (ZSL) aims to recognize novel classes by transferring semantic knowledge from seen classes to unseen classes. Though many ZSL methods rely on a direct mapping between the visual and the semantic space, the calibration deviation and hubness problem limit the generalization capability to unseen classes. Recently emerged generative ZSL methods generate unseen image features to transform ZSL into a supervised classification problem. However, most generative models still suffer from the seen-unseen bias problem as only seen data is used for training. To address these issues, we propose a novel bidirectional embedding based generative model with a tight visual-semantic coupling constraint. We learn a unified latent space that calibrates the embedded parametric distributions of both visual and semantic spaces. Since the embedding from high-dimensional visual features comprise much non-semantic information, the alignment of visual and semantic in latent space would inevitably been deviated. Therefore, we introduce information bottleneck (IB) constraint to ZSL for the first time to preserve essential attribute information during the mapping. Specifically, we utilize the uncertainty estimation and the wake-sleep procedure to alleviate the feature noises and improve model abstraction capability. In addition, our method can be easily extended to transductive ZSL setting by generating labels for unseen images. We then introduce a robust loss to solve this label noise problem. Extensive experimental results show that our method outperforms the state-of-the-art methods in different ZSL settings on most benchmark datasets. The code will be available at https://github.com/osierboy/IBZSL.

연구 동기 및 목표

  • 훈련 시에 볼 수 있는 데이터만을 기반으로 하는 생성 기반 제로샷 러닝 방법에서의 본문-비본문 편향을 해결한다.
  • 시각적 및 의미적 표현 간의 밀접한 결합을 강제하여 시각-의미 임베딩 공간에서의 캘리브레이션 편차와 허브니스를 감소시킨다.
  • 특징 매핑 중 핵심 속성 정보를 유지하기 위해 정보 버블링 제약을 통합하여 모델의 추상화 능력 향상과 노이즈에 대한 내성성 향상을 도모한다.
  • 비정상적인 이미지에 대한 의사 레이블 생성과 강력한 손실 함수를 통한 레이블 노이즈 완화를 통해 효과적인 전도성 제로샷 러닝을 가능하게 한다.
  • 통합된 시각적 및 의미적 공간 학습을 통해 일반화 능력을 향상시키고 다양한 ZSL 벤치마크에서 최신 기술 수준의 성능을 달성한다.

제안 방법

  • 시각적 및 의미적 특징을 공동으로 임bedding하여 통합된 잠재 공간을 학습하는 이중성 생성 모델을 제안하여 다중 모odal 간의 더 강력한 결합을 확보한다.
  • 잠재 공간에 정보 버블링(IB) 제약을 도입하여 고차원의 시각적 특징에서 비의미적 노이즈를 제거하고 핵심 속성 정보만을 유지한다.
  • 특징 노이즈에 대한 내성성 향상과 모델의 추상화 능력 향상을 위해 불확실성 추정과 웨이크-슬립 훈련 절차를 적용한다.
  • 비정상적인 ZSL에 대한 프레임워크 확장으로 비정상 이미지에 대한 의사 레이블 생성과 레이블 노이즈를 다루기 위한 강력한 손실 함수 적용을 수행한다.
  • 재구성 정밀도, 상호정보 보존, 잠재 공간 내 분류 정확도를 균형 잡는 공동 목표를 최적화하여 모델을 학습한다.
  • 시각적 및 의미적 임베딩을 모델링하기 위해 잠재 공간에서 매개변수화된 분포를 활용하여 기울기 기반 최적화로 종단 간 훈련을 가능하게 한다.

실험 결과

연구 질문

  • RQ1정보 버블링 제약을 통해 시각-의미 매핑 과정에서 핵심 의미적 속성 정보만을 유지함으로써 제로샷 러닝 모델의 일반화 능력을 향상시킬 수 있는가?
  • RQ2밀접한 시각-의미 결합을 갖는 이중성 임베딩은 제로샷 인식에서 캘리브레이션 편차와 허브니스를 어떻게 감소시키는가?
  • RQ3불확실성 추정과 웨이크-슬립 훈련은 제로샷 러닝에서 노이즈가 많은 특징에 대해 얼마나 내성성을 향상시킬 수 있는가?
  • RQ4비정상적인 이미지에 대해 신뢰할 수 있는 의사 레이블을 생성함으로써 제안된 방법이 전도성 ZSL로 효과적으로 확장될 수 있는가?
  • RQ5레이블 노이즈에 대한 강력한 손실 함수의 통합이 전도성 제로샷 러닝 환경에서 성능 향상에 기여하는가?

주요 결과

  • 제안된 IBZSL 방법은 유도적 및 전도성 제로샷 러닝 설정에서 대부분의 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성한다.
  • 정보 버블링 제약은 시각적 특징 내 비의미적 노이즈의 영향을 크게 감소시켜 시각적 및 의미적 공간 간의 정렬을 향상시킨다.
  • 불확실성 추정과 웨이크-슬립 훈련은 더 강력한 특징 추상화와 비정상 클래스로의 더 나은 일반화를 이끈다.
  • 의사 레이블 생성 과정에서 강력한 손실 함수를 활용함으로써 이 방법은 전도성 ZSL에서 레이블 노이즈를 효과적으로 다룬다.
  • 광범위한 실험을 통해 밀접한 결합을 갖는 이중성 생성 모델이 기존의 생성 및 판별 기반 ZSL 접근법을 능가함을 확인했다.
  • 다양한 데이터셋에서 일관된 성과를 보이며, 분포 이탈 상황에서도 강력한 일반화 능력을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.