Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Knowledge Fusion for New Feature Generation in Generalized Zero-Shot Learning

Hongxin Xiang, Cheng Xie|arXiv (Cornell University)|2021. 02. 23.
Domain Adaptation and Few-Shot Learning참고 문헌 67인용 수 4
한 줄 요약

이 논문은 다중 수준 지식(예: 계, 축, 종)을 융합하고 유전 전략을 활용한 적응형 신규 특징 생성기(NFG)를 사용하여 의미론적-시각적 특징 생성을 향상시키는 새로운 생성형 제로샷 학습 방법인 다중지식 융합 네트워크(MKFNet)를 제안한다. 이 방법은 의미론적 부족 문제와 도메인 이탈 문제를 완화함으로써 일반화 제로샷 학습 및 검색 벤치마크에서 최신 기술을 능가하는 성능을 달성한다.

ABSTRACT

Suffering from the semantic insufficiency and domain-shift problems, most of existing state-of-the-art methods fail to achieve satisfactory results for Zero-Shot Learning (ZSL). In order to alleviate these problems, we propose a novel generative ZSL method to learn more generalized features from multi-knowledge with continuously generated new semantics in semantic-to-visual embedding. In our approach, the proposed Multi-Knowledge Fusion Network (MKFNet) takes different semantic features from multi-knowledge as input, which enables more relevant semantic features to be trained for semantic-to-visual embedding, and finally generates more generalized visual features by adaptively fusing visual features from different knowledge domain. The proposed New Feature Generator (NFG) with adaptive genetic strategy is used to enrich semantic information on the one hand, and on the other hand it greatly improves the intersection of visual feature generated by MKFNet and unseen visual faetures. Empirically, we show that our approach can achieve significantly better performance compared to existing state-of-the-art methods on a large number of benchmarks for several ZSL tasks, including traditional ZSL, generalized ZSL and zero-shot retrieval.

연구 동기 및 목표

  • 기존 방법이 의미론적 표현이 제한적이거나 불완전하여 분류 가능한 의미론적 특징을 포착하지 못함으로써 발생하는 의미론적 부족 문제를 해결한다.
  • 학습된 클래스와 미학습된 클래스 간의 의미론적 및 시각적 분포가 크게 다름으로써 일반화 능력이 저하되는 도메인 이탈 문제를 극복한다.
  • 다양한 수준의 지식(예: 계, 축, 종)을 융합하여 더 대표성 있고 일반화된 시각적 특징을 생성함으로써 특징 일반화 능력을 향상시킨다.
  • 적응형 특징 생성 메커니즘을 통해 합성된 시각적 특징과 실제 미학습된 시각적 특징 간의 정렬을 향상시킨다.
  • 의미론적 및 시각적 특징 공간을 풍부하게 함으로써 일반화 제로샷 학습 및 제로샷 이미지 검색에서 뛰어난 성능을 달성한다.

제안 방법

  • 학습 가능한 융합 모듈을 사용하여 가족, 분류군, 종과 같은 다중 의미론적 지식 수준의 시각적 특징을 적응적으로 융합함으로써 특징 일반화를 향상시키는 다중지식 융합 네트워크(MKFNet)를 제안한다.
  • 기존 속성을 재가중 및 재조합하여 새로운 분류 가능한 의미론적 특징을 생성하는 적응형 유전 전략을 갖춘 신규 특징 생성기(NFG)를 도입함으로써 의미론적 표현력을 향상시킨다.
  • 다중 손실 학습 목표를 적용한다: NFG에서 의미론적 특징 품질 향상을 위한 $L_{ER}$, 적응형 유전 전략에서 합성된 특징과 실제 미학습된 시각적 특징 간의 교차를 증가시키기 위한 $L_{NR}$ 및 $L_{KR}$.
  • 의미론적 특징이 다양한 지식 수준에서 시각적 공간으로 맵핑되는 공유된 의미-시각적 임bedding 공간을 사용하며, 이를 통해 엔드 투 엔드 학습이 가능하도록 한다.
  • 검색 성능 평가를 위해 생성된 시각적 특징과 실제 미학습된 특징 간의 코사인 유사도를 사용하며, 정량적 분석을 위해 상위 5개의 검색된 이미지를 선택한다.
  • 의존성 메커니즘과 지식 그래프 기반 집합을 활용하여 데이터셋에 내장된 속성에만 의존하지 않고 의미론적 표현을 풍부하게 한다.

실험 결과

연구 질문

  • RQ1가족, 분류군, 종과 같은 다중 수준 지식 융합이 제로샷 학습에서 시각적 특징의 일반화 능력을 향상시키는가?
  • RQ2유전 전략을 통한 적응형 신규 의미론적 특징 생성이 합성된 시각적 특징의 분류 능력을 향상시키는가?
  • RQ3제안된 방법이 학습된 클래스와 미학습된 클래스 간의 도메인 이탈 문제를 어느 정도 감소시키는가?
  • RQ4다양한 의미론적 지식 융합이 합성된 특징과 실제 미학습된 시각적 특징 간의 정렬을 어떻게 향상시키는가?
  • RQ5제안된 방법이 일반화 제로샷 학습 및 제로샷 검색을 포함한 다양한 ZSL 벤치마크에서 최신 기술을 초월하는 성능을 달성할 수 있는가?

주요 결과

  • 제안된 MKFNet-NFG 방법은 CUB, AwA1, AwA2, FLO 등 다양한 벤치마크에서 전통적 ZSL, 일반화 ZSL, 제로샷 검색 작업 전반에서 최신 기술보다 유의미하게 뛰어난 성능을 달성한다.
  • MKFNet의 적응형 융합 모듈은 모든 데이터셋에서 가족, 분류군, 종과 같은 모든 지식 수준에 대해 비영이 중요도 가중치를 할당함으로써 각 지식 영역이 특징 생성에 의미 있는 기여를 하고 있음을 확인한다.
  • AwA1 및 AwA2 데이터셋에서 MKFNet-NFG는 거의 모든 미학습 카테고리에서 MKFNet(무료 NFG)보다 더 높은 정확도로 분류함을 보여주며, 신규 특징 생성기의 효과를 입증한다.
  • CUB 데이터셋에서의 정성적 검색 결과는 제안된 방법이 GAZSL에 비해 더 많은 올바른 이미지(초록 박스)를 검색하고 더 적은 잘못된 이미지(빨간 박스)를 검색함을 보여주며, 더 나은 특징 정렬 능력을 갖는다.
  • 생성된 시각적 중심과 실제 미학습된 특징 간의 높은 코사인 유사도를 통해 모델이 실제 미학습된 시각적 특징과 유사한 특징을 생성할 수 있음을 검증한다.
  • 제거 분석 결과, 다중지식 융합 및 적응형 특징 생성 구성 요소가 성능 향상에 필수적임을 확인하였으며, 각 요소가 의미론적 부족 문제와 도메인 이탈 문제를 줄이는 데 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.