Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Learning of Compositional Energy Concepts

Yilun Du, Shuang Li|arXiv (Cornell University)|2021. 11. 04.
Advanced Image and Video Retrieval Techniques참고 문헌 53인용 수 11
한 줄 요약

COMET는 전역(예: 조명, 날씨)과 국소(예: 물체 정체성, 색상)적 변동 인자를 별개의 에너지 함수로 발견하는 비지도 학습 프레임워크를 제안한다. 이러한 에너지 함수의 합을 최적화함으로써 COMET는 개념 재조합을 통해 이미지를 생성하고, 데이터셋 및 모odal 간 일반화를 가능하게 하며, 지도 학습 없이도 서로 다른 데이터셋과 모달 간의 구성적 특성 학습을 수행한다.

ABSTRACT

Humans are able to rapidly understand scenes by utilizing concepts extracted from prior experience. Such concepts are diverse, and include global scene descriptors, such as the weather or lighting, as well as local scene descriptors, such as the color or size of a particular object. So far, unsupervised discovery of concepts has focused on either modeling the global scene-level or the local object-level factors of variation, but not both. In this work, we propose COMET, which discovers and represents concepts as separate energy functions, enabling us to represent both global concepts as well as objects under a unified framework. COMET discovers energy functions through recomposing the input image, which we find captures independent factors without additional supervision. Sample generation in COMET is formulated as an optimization process on underlying energy functions, enabling us to generate images with permuted and composed concepts. Finally, discovered visual concepts in COMET generalize well, enabling us to compose concepts between separate modalities of images as well as with other concepts discovered by a separate instance of COMET trained on a different dataset. Code and data available at https://energy-based-model.github.io/comet/.

연구 동기 및 목표

  • 전체적으로 전역 및 국소 시각적 개념을 통합된 프레임워크에서 비지도 학습 방법으로 발견하는 것.
  • 다른 데이터셋 및 모달 간에 개념을 조합할 수 있도록 하는 것, 예를 들어 한 데이터셋의 표정과 다른 데이터셋의 조명을 조합하는 것.
  • 시각적 인자를 에너지 함수로 표현하여, 해당 인자를 포함한 장면에는 낮은 에너지를, 그렇지 않은 장면에는 높은 에너지를 할당함으로써 최적화 기반 이미지 생성을 가능하게 하는 것.
  • 합성 또는 제한된 도메인 벤치마크를 넘어서 실제적이고 다양한 데이터셋에 대해 분리된 인자를 스케일링할 수 있도록 하는 것.
  • 학습된 구성 요소가 다양한 데이터 분포 및 모달 간에 일반화되는 정도를 입증하는 것, 이미지 간 재조합 및 교차 데이터셋 재조합 포함.

제안 방법

  • COMET는 각 시각적 개념을 에너지 함수로 표현하며, 해당 인자를 포함한 이미지에는 낮은 에너지를, 그렇지 않은 이미지에는 높은 에너지를 할당한다.
  • 모델은 레이블이 없는 지도 학습 없이, 에너지 함수 재조합을 통한 이미지 복원을 강제함으로써 에너지 함수를 발견한다.
  • 이미지 생성은 모든 에너지 함수의 합을 최소화하는 최적화 과정으로 설정되며, 최소 에너지 상태에서 입력 이미지가 재구성된다.
  • 에너지 함수는 공간적 구조를 유지하기 위해 위치 임베딩을 사용하는 딥 네트워크로 학습되며, 이를 제거함으로써 전역 인자 발견이 촉진된다.
  • 한 데이터셋에서 학습된 COMET 모델의 구성 요소는 다른 데이터셋에서 학습된 다른 COMET 모델의 구성 요소와 조합될 수 있어 교차 데이터셋 일반화가 가능하다.
  • 다양한 모달 간 데이터셋(예: CelebA-HQ와 Danbooru, KITTI와 Virtual KITTI)을 사용하여 COMET를 학습하고, 도메인 간 일관된 분해 및 재조합을 검증한다.

실험 결과

연구 질문

  • RQ1비지도 학습 방법이 통합된 에너지 기반 프레임워크에서 전역 및 국소 시각적 인자를 동시에 발견할 수 있는가?
  • RQ2COMET는 서로 다른 데이터셋 간에 개념을 조합할 수 있는가, 예를 들어 CLEVR에서의 물체 정체성과 CLEVR Lighting에서의 조명을 조합하는가?
  • RQ3한 모달리티(예: 얼굴 이미지)에서 발견된 에너지 함수가 다른 모달리티(예: 자동차 이미지)에서 발견된 함수와 의미 있게 재조합될 수 있는가?
  • RQ4COMET의 구성 요소는 다양한 데이터 분포 및 모달 간에 얼마나 잘 일반화되는가?
  • RQ5COMET는 지도 학습 없이도 조명, 표정, 물체 정체성 등의 인자를 얼마나 잘 분리할 수 있는가?

주요 결과

  • COMET는 하나의 비지도 학습 프레임워크에서 전역 인자(예: 조명)와 국소 인자(예: 물체 정체성, 표정)를 성공적으로 발견하였으며, 정성적 분석을 통해 올바른 인자 할당이 이루어졌음을 확인하였다.
  • 모델은 에너지 함수의 합을 최적화하는 방식으로 이미지 생성을 수행하며, 총 에너지를 최소화함으로써 입력 이미지를 재구성한다.
  • COMET는 교차 데이터셋 조합을 보여주며, CLEVR와 CLEVR Toy에서 유래한 구성 요소를 재조합하여 다양한 물체 유형을 가진 새로운 이미지를 생성할 수 있다.
  • CelebA-HQ와 Danbooru에서 학습된 COMET의 구성 요소는 다양한 모달 간에 일관되게 분리되어 있으며, 헤어 색상, 피부 톤, 표정 등의 속성을 선택적으로 조작할 수 있다.
  • COMET는 다중 모달 데이터셋에 일반화되어 있으며, KITTI의 조명과 Virtual KITTI의 물체 특징을 재조합함으로써 도메인 간 인자 조합을 성공적으로 수행하였다.
  • 일부 엉키는 요소(예: 재구성에서 조명 아티팩트)가 존재하지만, COMET는 전역 및 국소 인자를 동시에 모델링하는 데 있어 이전의 비지도 학습 방법보다 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.