[논문 리뷰] GENESIS-V2: Inferring Unordered Object Representations without Iterative Refinement
GENESIS-V2는 반복적 보정이나 RNN을 사용하지 않고 순서 없는 변수 수의 객체 표현을 추론하기 위해 확률적 스틱 브레이킹 프로세스(IC-SBP)를 사용하는 미분 가능이고 임베딩 기반의 클러스터링 방법을 제안한다. 이는 합성 및 복잡한 실세계 데이터셋인 Sketchy와 APC에서 비지도 이미지 분할 및 객체 중심 생성에서 최신 기술 수준(SOTA) 성능을 달성한다.
Advances in unsupervised learning of object-representations have culminated in the development of a broad range of methods for unsupervised object segmentation and interpretable object-centric scene generation. These methods, however, are limited to simulated and real-world datasets with limited visual complexity. Moreover, object representations are often inferred using RNNs which do not scale well to large images or iterative refinement which avoids imposing an unnatural ordering on objects in an image but requires the a priori initialisation of a fixed number of object representations. In contrast to established paradigms, this work proposes an embedding-based approach in which embeddings of pixels are clustered in a differentiable fashion using a stochastic stick-breaking process. Similar to iterative refinement, this clustering procedure also leads to randomly ordered object representations, but without the need of initialising a fixed number of clusters a priori. This is used to develop a new model, GENESIS-v2, which can infer a variable number of object representations without using RNNs or iterative refinement. We show that GENESIS-v2 performs strongly in comparison to recent baselines in terms of unsupervised image segmentation and object-centric scene generation on established synthetic datasets as well as more complex real-world datasets.
연구 동기 및 목표
- 기존의 비지도 객체 중심 모델이 RNN이나 반복적 보정에 의존함으로써 자연스럽지 않은 순서를 부여하거나 확장성에 문제가 있다는 점을 해결하기 위해.
- 사전에 고정된 수의 객체 슬롯을 초기화할 필요 없이 변수 수의 객체 표현을 추론할 수 있는 방법을 개발하기 위해.
- 픽셀 임베딩을 주의 맵으로 미분 가능하게 클러스터링하여 비지도 인스턴스 분할 및 장면 생성을 위한 엔드 투 엔드 학습을 가능하게 하기 위해.
- 이전 모델이 배경과 전경 객체를 분리하지 못하는 복잡한 실세계 데이터셋에서 일반화 능력과 강건성을 향상시키기 위해.
- 합성 벤치마크와 도전적인 실세계 데이터셋 모두에서 접근법을 검증하여 분할 및 생성에서 뛰어난 성능을 보여주기 위해.
제안 방법
- 픽셀 임베딩에서 클러스터 시드를 확률적으로 샘플링하여 소프트 주의 맵을 형성하는, 미분 가능한 클러스터링 메커니즘인 인스턴스 색상 스틱 브레이킹 프로세스(IC-SBP)를 제안한다.
- IC-SBP를 사용하여 반복적 보정이나 RNN 없이 순서 없는 변수 크기의 객체 표현 집합으로 픽셀 임베딩을 그룹화한다.
- 변분 오토인코더 프레임워크에 IC-SBP를 통합하여 추론과 생성을 동시에 학습하고, 객체 중심 장면 생성을 가능하게 한다.
- 원래의 GENESIS 모델에서 영감을 얻어 객체 슬롯 간의 관계를 모델링하기 위해 객체 슬롯에 대한 자동회귀 사전분포를 사용한다.
- 미분 가능 클러스터링을 활용해 분할 과정을 거쳐 역전파가 가능하게 하여 후처리 없이 엔드 투 엔드 학습을 가능하게 한다.
- 모델을 합성 데이터셋(ObjectsRoom, ShapeStacks)과 실세계 데이터셋(Sketchy, APC)에 적용하며, 객체 수나 정체성에 대한 지도 학습 없이도 학습한다.
실험 결과
연구 질문
- RQ1비지도 장면 이해에서 순서 없는 객체 표현을 학습하기 위해 반복적 보정이나 RNN을 대체할 수 있는 미분 가능 클러스터링 메커니즘이 가능한가?
- RQ2픽셀 임베딩에 대한 확률적 스틱 브레이킹 프로세스가 사전에 슬롯 초기화 없이도 변수 수의 분리된 객체 표현을 가능하게 하는가?
- RQ3제안된 방법이 높은 시각적 및 구조적 다양성을 지닌 복잡한 실세계 이미지에 얼마나 잘 일반화되는가?
- RQ4모델은 지도 학습 없이도 비지도 이미지 분할과 객체 중심 장면 생성에서 경쟁 가능한 성능을 달성할 수 있는가?
- RQ5반복 처리가 없는 것이 학습 안정성을 향상시키고 단일 객체 슬롯으로 붕괴되는 것을 방지하는가?
주요 결과
- APC 데이터셋에서 GENESIS-V2는 모든 베이스라인(스лот 어텐션 및 기존 GENESIS 포함)보다 높은 ARI(0.55)와 MSC(0.67) 점수를 기록했다.
- Sketchy 데이터셋에서 GENESIS-V2는 다른 모델들보다 낮은 FID 점수(208.1)를 기록하여 객체 중심 이미지 생성에서 뛰어난 샘플 품질을 보였다.
- 도전적인 APC 데이터셋에서 GENESIS-V2는 평가된 모델들 중에서 유일하게 전경 객체를 배경에서 정확히 분리하는 데 성공했다.
- 정성적 결과에서 GENESIS-V2는 Sketchy 데이터셋에서 개별 객체와 로봇 그립퍼를 명확히 구분했으며, 슬롯 어텐션보다 더 나은 성능을 보였다.
- 모델는 시각적 복잡성에 강건하고 실세계 데이터로의 일반화 능력을 보였지만, 때로는 객체를 과도하게 분할하는 경향이 있어 향후 개선 여지가 있다.
- GENESIS-V2는 합성 벤치마크(ObjectsRoom, ShapeStacks)에서도 뛰어난 성능을 기록하여 통제된 객체 중심 환경에서의 효과성을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.