Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Effective Deep Embedding for Zero-Shot Learning

Lei Zhang, Peng Wang|arXiv (Cornell University)|2018. 08. 30.
Domain Adaptation and Few-Shot Learning참고 문헌 31인용 수 6
한 줄 요약

이 논문은 제로샷 러닝을 위한 두 분지 구조의 딥 네트워크를 제안하며, 내부 클래스의 응집성과 상호 클래스 간의 분리성이라는 두 가지 특성을 명시적으로 학습하는 공동 임bedding 공간을 학습한다. 시각적 임베딩을 그에 해당하는 클래스-의미적 표현으로 회귀시키고, 학습 가능한 분류기로 상호 클래스 간의 구분을 강제함으로써, 다섯 개인 표준 ZSL 벤치마크에서 최신 기술 수준의 성능을 달성한다. 더불어, 본 모델의 편향을 감소시키기 위해 투명한 가짜 레이블링 전략을 도입함으로써 추가적인 성능 향상을 이룬다.

ABSTRACT

Zero-shot learning (ZSL) can be formulated as a cross-domain matching problem: after being projected into a joint embedding space, a visual sample will match against all candidate class-level semantic descriptions and be assigned to the nearest class. In this process, the embedding space underpins the success of such matching and is crucial for ZSL. In this paper, we conduct an in-depth study on the construction of embedding space for ZSL and posit that an ideal embedding space should satisfy two criteria: intra-class compactness and inter-class separability. While the former encourages the embeddings of visual samples of one class to distribute tightly close to the semantic description embedding of this class, the latter requires embeddings from different classes to be well separated from each other. Towards this goal, we present a simple but effective two-branch network to simultaneously map semantic descriptions and visual samples into a joint space, on which visual embeddings are forced to regress to their class-level semantic embeddings and the embeddings crossing classes are required to be distinguishable by a trainable classifier. Furthermore, we extend our method to a transductive setting to better handle the model bias problem in ZSL (i.e., samples from unseen classes tend to be categorized into seen classes) with minimal extra supervision. Specifically, we propose a pseudo labeling strategy to progressively incorporate the testing samples into the training process and thus balance the model between seen and unseen classes. Experimental results on five standard ZSL datasets show the superior performance of the proposed method and its transductive extension.

연구 동기 및 목표

  • 보기 드문 클래스 샘플이 자주 보고 있는 클래스로 잘못 분류되는 제로샷 러닝의 모델 편향 문제를 해결한다.
  • 내부 클래스의 응집성과 상호 클래스 간 분리성이라는 두 가지 조건을 명시적으로 설계한 임베딩 공간을 통해 제로샷 러닝의 일반화 성능을 향상시킨다.
  • 시험 시간 정보를 가짜 레이블링을 통해 통합하는 투명한 확장 기법을 개발하여, 보고 있는 클래스와 보지 않은 클래스 간의 성능 격차를 줄인다.
  • 내부 클래스의 응집성과 상호 클래스 간 분리성이라는 두 가지 기준을 명시적으로 학습한 공동 임베딩 공간을 통해, 암묵적인 호환성 함수나 고정된 의미/시각적 공간에 의존하는 기존 방법보다 더 나은 제로샷 인식 성능을 달성할 수 있음을 입증한다.

제안 방법

  • 시각적 샘플과 클래스 수준의 의미적 기술을 공통 잠재 임베딩 공간으로 매핑하는 두 분지 구조의 딥 신경망을 설계한다.
  • 시각적 임베딩을 해당 클래스의 의미적 임베딩으로 회귀시키는 데서 내부 클래스의 응집성을 강제로 확보하기 위해 회귀 손실을 사용한다.
  • 다른 클래스들 간의 구분을 위해 임bedded 특징에 대해 분류기를 훈련시키며, 교차 엔트로피 손실을 사용하여 상호 클래스 간 분리성을 확보한다.
  • 공동 임베딩 공간에서 작동하는 학습 가능한 분류기 헤드를 도입하여, 클래스 간에 구별 가능한 특징을 확보한다.
  • 시험 시점의 정보를 가짜 레이블링 전략을 통해 통합하는 투명한 설정으로 방법을 확장한다. 이는 고신뢰도의 테스트 샘플을 반복적으로 선택하고 학습 과정에 통합한다.
  • 라운드 단위로 모델을 校정하며, 점진적으로 가짜 레이블이 부여된 보지 않은 클래스 샘플들을 추가하여 임베딩 공간을 정교화하고, 보고 있는 클래스와 보지 않은 클래스 간의 성능 균형을 맞춘다.

실험 결과

연구 질문

  • RQ1임베딩 공간에서 내부 클래스의 응집성과 상호 클래스 간 분리성에 대한 명시적 최적화가 기존 방법보다 더 나은 제로샷 일반화 성능을 이끌 수 있는가?
  • RQ2의미 공간이나 시각적 공간을 고정하고 단방향 매핑에 의존하는 기존 접근법과 비교할 때, 제안된 방법은 어떻게 성능을 냅니다?
  • RQ3투명한 가짜 레이블링 전략이 제로샷 러닝에서 보고 있는 클래스에 대한 모델 편향을 어느 정도 줄일 수 있는가?
  • RQ4가짜 레이블이 부여된 시험 샘플을 반복적으로 정교화함으로써, 진짜 레이블이 없는 상황에서도 보지 않은 클래스의 인식 정확도가 향상되는가?

주요 결과

  • 제안된 방법은 다섯 개의 표준 제로샷 러닝 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, 전통적 ZSL 및 일반화된 ZSL 설정 모두에서 기존 방법을 능가한다.
  • 투명한 확장(Our_ex)은 보지 않은 클래스에서의 인식 정확도를 크게 향상시키며, 모델 校정의 라운드가 진행될수록 성능이 향상된다.
  • 가짜 레이블링 전략은 첫 번째 라운드에서 선택된 보지 않은 클래스 샘플들에 대해 70% 이상의 예측 정확도를 달성하며, 이후 각 라운드에서 약간씩 향상된다.
  • 모델은 하이퍼파rameter λ의 넓은 범위에서 안정적으로 작동하지만, λ = 0일 경우 성능이 붕괴됨으로써 상호 클래스 간 분리성 정규화의 필요성을 확인한다.
  • 투명한 校정 과정 동안 보고 있는 클래스의 인식 정확도는 안정적으로 유지되며, 이는 시험 시간 데이터를 통합함에도 불구하고 보고 있는 클래스의 성능이 떨어지지 않음을 의미한다.
  • AwA1에 대한 시각화 결과는 제안된 임베딩 공간이 기존 방법보다 보지 않은 클래스 샘플을 더 잘 분리하고, 의미 프로토타입과 더 가깝게 정렬하고 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.