Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Object-Centric Representations of Multi-Object Scenes from Multiple Views

Nanbo Li, Cian Eastwood|arXiv (Cornell University)|2021. 11. 13.
Domain Adaptation and Few-Shot Learning인용 수 19
한 줄 요약

MulMON은 반복적인 암시적 추론과 시점 예측을 통해 다중 시점에서 잠재 객체 특징을 반복적으로 개선함으로써, 다중 객체 장면에 대해 정확하고 객체 중심의 표현을 학습하는 비지도 학습 방법을 제안한다. 이는 공간적 모호성을 해결하고, 개선된 분리성, 3D 구조 포착 능력 및 새로운 시점에서의 외관 및 세그멘테이션 예측이라는 새로운 기능을 제공하며, 단일 시점 기반 모델들을 능가한다.

ABSTRACT

Learning object-centric representations of multi-object scenes is a promising approach towards machine intelligence, facilitating high-level reasoning and control from visual sensory data. However, current approaches for unsupervised object-centric scene representation are incapable of aggregating information from multiple observations of a scene. As a result, these "single-view" methods form their representations of a 3D scene based only on a single 2D observation (view). Naturally, this leads to several inaccuracies, with these methods falling victim to single-view spatial ambiguities. To address this, we propose The Multi-View and Multi-Object Network (MulMON) -- a method for learning accurate, object-centric representations of multi-object scenes by leveraging multiple views. In order to sidestep the main technical difficulty of the multi-object-multi-view scenario -- maintaining object correspondences across views -- MulMON iteratively updates the latent object representations for a scene over multiple views. To ensure that these iterative updates do indeed aggregate spatial information to form a complete 3D scene understanding, MulMON is asked to predict the appearance of the scene from novel viewpoints during training. Through experiments, we show that MulMON better-resolves spatial ambiguities than single-view methods -- learning more accurate and disentangled object representations -- and also achieves new functionality in predicting object segmentations for novel viewpoints.

연구 동기 및 목표

  • 부분적 시야와 가림 현상으로 인해 공간적 모호성이 발생하는 단일 시점 비지도 객체 중심 방법의 한계를 해결하기 위해.
  • 정적 다중 객체 장면의 다수 2D 시점에서의 정보를 융합하여 정확하고 분리된 3D 장면 이해를 실현하기 위해.
  • 명시적 매칭 없이도 시점 간 객체 대응 관계를 유지함으로써 다중 객체-다중 시점(MOMV) 문제를 해결하기 위해.
  • 관측되지 않은 시점에서 외관과 객체 세그멘테이션을 동시에 예측할 수 있는 새로운 기능을 도입하기 위해.
  • 반복 업데이트가 공간 정보를 축적하는 것이 아니라 상실하는 것을 방지하기 위해, 새로운 시점 예측을 학습 신호로 사용하기 위해.

제안 방법

  • MulMON은 공간 혼합 모델과 반복적 암시적 추론을 사용하여 다중 시점 간 잠재 객체 표현을 개선한다.
  • 다른 시점 간 '외부 루프' 반복을 수행하여 이전 반복의 사전 확률을 후행 분포의 사전으로 사용해 객체 표현의 후행 분포를 갱신한다.
  • 각 시점 내부에서는 주목적 기반 슬롯 주목과 변분 추론을 사용해 잠재 특징을 반복적으로 개선한다.
  • 모델은 재구성 손실(새로운 시점 예측을 위한)과 불확실성 감소를 장려하는 정보 수익 항을 포함한 변분 하한(ELBO)을 최적화하여 학습한다.
  • 다양한 시점 간 공통된 슬롯 주목 메커니즘의 사용과 반복적 개선을 통해 객체 대응 관계를 암묵적으로 유지한다.
  • 현재 잠재 표현 기반으로 관측과 세그멘테이션을 예측하기 위해 미분 가능한 렌더러를 활용한다.

실험 결과

연구 질문

  • RQ1다중 시점 간 반복적 개선이 단일 시점의 공간적 모호성을 해결함으로써 객체 중심 표현의 정확도를 향상시킬 수 있는가?
  • RQ2다중 객체-다중 시점 모델이 단일 시점 기반 모델 대비 더 나은 객체 특성과 3D 구조의 분리성을 달성할 수 있는가?
  • RQ3모델이 관측되지 않은 시점에서 외관과 객체 세그멘테이션을 모두 예측하는 데 일반화할 수 있는가?
  • RQ4시점 수(T)가 다중 객체 설정에서 불확실성 감소와 표현 품질에 어떤 영향을 미치는가?
  • RQ5제안된 방법이 상호 객체 및 내부 객체 분리성을 달성하여 제어 가능한 장면 조작을 가능하게 하는가?

주요 결과

  • MulMON은 다중 시점 정보를 활용해 공간적 불확실성을 크게 감소시키며, 불확실성 대 T 곡선에서 단 몇 개의 관측 이후에 급격히 감소하는 것으로 나타났다.
  • CLE-MV 및 CLE-Aug 데이터셋에서 MulMON은 Eastwood와 Williams 평가 프로토콜을 기준으로 IODINE와 GQN보다 더 분리도가 높고, 컴팩트하며 정보가 풍부한 객체 표현을 학습했다.
  • MulMON은 수직축 기준 회전과 같은 3D 장면 구조를 성공적으로 포착했으며, 조작 과정에서 다양한 시점 간 일관되게 이 정보를 전파했다.
  • MulMON은 다중 객체-다중 시점 문제에 대해 처음으로 실현 가능한 해결책을 제시했으며, 시점 쿼리 기반 객체 세그멘테이션과 같은 새로운 功能을 가능하게 했다.
  • 제거 실험 결과에서 시점 수(T)가 가장 중요한 하이퍼파라미터임을 확인했으며, 소수의 관측으로도 성능 향상이 급격히 이루어지는 것으로 나타났다.
  • MulMON은 상호 객체 및 내부 객체 분리성을 동시에 확보했으며, 다른 객체에 영향을 주지 않고도 단일 객체 또는 단일 속성 조작이 가능했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.