Skip to main content
QUICK REVIEW

[논문 리뷰] SlotFormer: Unsupervised Visual Dynamics Simulation with Object-Centric Models

Ziyi Wu, Nikita Dvornik|arXiv (Cornell University)|2022. 10. 12.
Multimodal Machine Learning Applications인용 수 10
한 줄 요약

SlotFormer는 비디오에서 객체 중심 표현을 기반으로 하여 비지도 시각적 동역학을 학습하는 Transformer 기반의 자동회귀 모델을 제안한다. 이는 장기 예측 비디오 생성에서 최고 성능을 기록하며, 추가적인 지도 학습 없이도 VQA 및 목표 조건 계획과 같은 후행 작업을 향상시킨다.

ABSTRACT

Understanding dynamics from visual observations is a challenging problem that requires disentangling individual objects from the scene and learning their interactions. While recent object-centric models can successfully decompose a scene into objects, modeling their dynamics effectively still remains a challenge. We address this problem by introducing SlotFormer -- a Transformer-based autoregressive model operating on learned object-centric representations. Given a video clip, our approach reasons over object features to model spatio-temporal relationships and predicts accurate future object states. In this paper, we successfully apply SlotFormer to perform video prediction on datasets with complex object interactions. Moreover, the unsupervised SlotFormer's dynamics model can be used to improve the performance on supervised downstream tasks, such as Visual Question Answering (VQA), and goal-conditioned planning. Compared to past works on dynamics modeling, our method achieves significantly better long-term synthesis of object dynamics, while retaining high quality visual generation. Besides, SlotFormer enables VQA models to reason about the future without object-level labels, even outperforming counterparts that use ground-truth annotations. Finally, we show its ability to serve as a world model for model-based planning, which is competitive with methods designed specifically for such tasks.

연구 동기 및 목표

  • 비디오 내 객체 간 장기적인 시공간 상호작용을 포괄하는 통합적이고 비지도적인 시각적 동역학 시뮬레이션 방법을 개발하는 것.
  • 개별 객체와 그 운동을 분리하는 객체 중심 표현을 활용하여 비디오 예측 성능을 향상시키는 것.
  • 비지도 동역학 지식을 후행 지도 학습 작업, 예를 들어 시각질문응답(VQA) 및 목표 조건 계획에 전이하는 것.
  • 소거 또는 재등장하는 객체가 있을 경우에도 정확한 동역학 시뮬레이션을 유지하여 가림 및 재등장에 대한 강건성을 확보하는 것.
  • 단일 통합 동역학 모델이 생성 및 추론 작업 양쪽에서 전문화된 모델을 능가할 수 있음을 보여주는 것.

제안 방법

  • SlotFormer는 사전 학습된 객체 중심 모델(예: SAVi)을 통해 비디오 프레임에서 추출한 객체 중심 특징을 기반으로 작동하며, 각 객체를 학습 가능한 슬롯으로 간주한다.
  • 과거의 여러 타임스텝에 걸친 객체 슬롯을 참조하여 미래의 객체 특징을 예측하기 위해 Transformer 기반의 자동회귀 디코더를 사용한다.
  • 입력 프레임 시퀀스에 조건을 두어 시공간적 관계를 포착하고 객체의 성질과 운동의 일관성을 유지할 수 있도록 한다.
  • 어텐션 메커니즘을 통해 가림 상태일지라도 관련 타임스텝과 객체에 주목함으로써 충돌과 같은 객체 상호작용을 추론할 수 있다.
  • 객체 수준의 애너테이션 없이 미래 프레임의 재구성 손실을 사용하여 엔드 투 엔드로 비지도 방식으로 학습한다.
  • 후행 작업을 위해 예측된 객체 특징에 작업 전용 리더아웃 헤드를 추가하여 VQA나 계획을 수행하며, 레이블에 대한 추가 미세조정 없이도 가능하다.

실험 결과

연구 질문

  • RQ1객체 중심 표현을 기반으로 하는 Transformer 기반 모델이 장기 예측에 있어 비지도 비디오 예측에서 최고 성능을 달성할 수 있는가, 특히 장기 시계열에서?
  • RQ2비지도 동역학 지식이 비디오 예측에서 유도된 후행 지도 학습 작업, 예를 들어 VQA 및 목표 조건 계획에서 성능 향상에 얼마나 기여하는가?
  • RQ3충돌이나 객체 재등장과 같은 새로운 객체 상호작용 및 동적 사건에 대해 모델의 일반화 능력은 어느 정도인가?
  • RQ4객체가 가려지거나 이후 프레임에서만 나타나는 경우(즉, 버닝 인 프레임 동안)에도 정확한 동역학 시뮬레이션을 유지할 수 있는가?
  • RQ5자기 어텐션을 통한 시공간 관계의 통합 모델링이 이전 방법보다 더 충실하고 일관된 객체 운동 예측을 이끌어내는가?

주요 결과

  • SlotFormer는 OBJ3D 및 CLEVRER 두 개의 비디오 예측 벤치마크에서 최고 성능을 기록하였으며, 특히 객체 인식 지표에서 장기 예측 성능 향상이 두드러졌다.
  • CLEVRER 데이터셋에서 SlotFormer는 Fréchet Video Distance(FVD) 11.2를 기록하여 비디오 품질과 객체 수준의 일관성에서 이전 방법을 능가했다.
  • VQA를 위한 월드 모델로 사용했을 때, 객체 수준의 애너테이션이 없더라도 CLEVR-VQA 데이터셋에서 정확도를 6.8% 향상시켰다.
  • 목표 조건 계획을 위한 환경인 Physion에서, SlotFormer는 전용으로 계획을 위한 모델을 학습한 것과 경쟁 수준의 성공률을 달성했다.
  • 절단 실험 결과, 최대 15개의 버닝 인 프레임(T=15)을 사용할 경우 성능 향상이 있었으며, VQA 정확도 향상에 최적의 성능을 내기 위해 롤아웃 길이 K=10까지 확장할 수 있었다.
  • CLEVRER에서 새로운 객체가 버닝 인 프레임 동안 등장하는 상황에서도 정확한 운동 예측이 가능함을 입증하여, 초기에는 보이지 않더라도 동역학을 성공적으로 추론함을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.