Skip to main content
QUICK REVIEW

[논문 리뷰] Disentangling Visual Embeddings for Attributes and Objects

Nirat Saini, Khoi Pham|arXiv (Cornell University)|2022. 05. 17.
Domain Adaptation and Few-Shot Learning인용 수 8
한 줄 요약

이 논문은 이미지 트리플릿(대상, 동일한 객체이지만 다른 속성, 동일한 속성이지만 다른 객체)을 이용한 대비 학습을 통해 시각적 특징을 별개의 객체 및 속성 구성요소로 분리하는 새로운 방법인 객체 속성 분리(OADis)를 제안한다. 분리된 특징에서 보이는 및 보지 못한 속성-객체 조합을 환기함으로써 OADis는 MIT-States, UT-Zappos, 그리고 새로운 VAW 기반 벤치마크에서 최신 기술을 압도적으로 뛰어넘는 성능을 달성한다.

ABSTRACT

We study the problem of compositional zero-shot learning for object-attribute recognition. Prior works use visual features extracted with a backbone network, pre-trained for object classification and thus do not capture the subtly distinct features associated with attributes. To overcome this challenge, these studies employ supervision from the linguistic space, and use pre-trained word embeddings to better separate and compose attribute-object pairs for recognition. Analogous to linguistic embedding space, which already has unique and agnostic embeddings for object and attribute, we shift the focus back to the visual space and propose a novel architecture that can disentangle attribute and object features in the visual space. We use visual decomposed features to hallucinate embeddings that are representative for the seen and novel compositions to better regularize the learning of our model. Extensive experiments show that our method outperforms existing work with significant margin on three datasets: MIT-States, UT-Zappos, and a new benchmark created based on VAW. The code, models, and dataset splits are publicly available at https://github.com/nirat1606/OADis.

연구 동기 및 목표

  • 표준 사전 훈련된 시각적 백본에서 속성과 객체 특징가 뒤섞여 있는 구성적 제로샷 학습 문제를 해결하기 위해.
  • 사전 훈련 중 데이터 증강으로 인해 발생하는 속성 불변 표현의 한계를 극복하기 위해.
  • 정확한 환기(홀로지)를 가능하게 하는 분리된 시각적 특징을 학습하여 보다 나은 일반화를 달성하기 위해.
  • 언어적 지도보다는 시각적 공간에서의 분리에 초점을 맞추어, 단어 임베딩의 구조를 시각 도메인에 모방하기 위해.
  • 실생활의 복잡한 환경에서의 구성적 제로샷 학습을 위한 새로운 VAW 기반 벤치마크를 도입하기 위해.

제안 방법

  • OADis는 세 가지 핵심 네트워크를 갖춘 트리플릿 기반 아키텍처를 사용한다: 객체 조건 네트워크, 레이블 임베더, 속성/객체 유사도 네트워크를 통해 시각적 특징을 분리한다.
  • 각 입력 이미지에 대해, 동일한 객체이지만 다른 속성(예: 껍질 벗긴 사과 대비 썰어진 사과)을 가진 참조 이미지를 검색하고, 동일한 속성이지만 다른 객체(예: 껍질 벗긴 사과 대비 껍질 벗긴 오렌지)를 가진 참조 이미지도 검색한다.
  • 속성 유사도 네트워크와 객체 유사도 네트워크는 각각 입력 이미지와 참조 이미지 간의 시각적 유사도 및 이질도 특징을 추출하여 속성과 객체의 분리된 표현을 고립한다.
  • 분리된 특징은 사전 훈련된 GloVe 단어 임베딩과 결합되어 분류 손실 및 대비 손실을 계산하여 속성 및 객체 예측을 위한 목적함수로 사용된다.
  • 모델은 분리된 특징을 이용해 보이는(예: 썰어진 사과) 및 보지 못한(예: 썰어진 오렌지) 조합을 환기하고, 임베딩 공간을 정규화하기 위해 구성성 손실을 적용한다.
  • 훈련 중 수평 반전 및 무작위 컷과 같은 이미지 증강 기법을 적용하였으며, 이는 모든 베이스라인 및 OADis에서 성능 향상을 이끌어냈다.

실험 결과

연구 질문

  • RQ1언어적 지도 없이도 시각적 특징를 독립적인 객체 및 속성 구성요소로 효과적으로 분리할 수 있는가?
  • RQ2분리된 시각적 특징에서 새로운 속성-객체 조합을 환기함으로써 구성적 학습에서 제로샷 일반화 성능이 향상되는가?
  • RQ3언어적 지도와 비교했을 때, 시각적 분리가 제로샷 속성-객체 인식에서 성능 및 내구성 측면에서 어떻게 우월한가?
  • RQ4분리된 시각적 특징을 기반으로 한 모델이 새로운 조합에 대해 의미 있는 근접한 이웃을 검색할 수 있는가?
  • RQ5객체가 다수의 속성을 가진 실생활의 다중 속성 환경에서 모델의 일반화 능력은 어느 정도인가?

주요 결과

  • OADis는 MIT-States, UT-Zappos, 그리고 새로운 VAW 기반 벤치마크에서 최신 기술을 압도적으로 뛰어넘는 성능을 달성한다.
  • MIT-States에서 OADis는 AUC 88.7%를 기록하여 이전 최고 성능보다 5퍼센트 이상 높게 기록한다.
  • UT-Zappos에서 OADis는 AUC 77.3%를 기록하여 더 다양하고 도전적인 데이터셋에 대한 강력한 일반화 능력을 보여준다.
  • 정성적 결과에서는 분리된 특징에서 환기된 조합이 조건이 맞는 테스트 세트 이미지를 조건에 맞게 검색함을 확인했으며, '썰어진 오렌지'와 같이 보지 못한 쌍에 대해서도 성공적으로 작동한다.
  • 정답 레이블이 상위 1위에 포함되지 않더라도, 실제 데이터의 다중 레이블 특성을 반영하여 상위 3개 예측에서 정확한 속성 및 객체 기술을 예측한다.
  • 제거 실험 결과, 객체 조건 네트워크와 이미지 증강 기법이 성능 향상에 크게 기여하며, 증강 기법은 모든 방법의 AUC를 약 1.0~1.5% 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.