Skip to main content
QUICK REVIEW

[논문 리뷰] Sequential Attend, Infer, Repeat: Generative Modelling of Moving Objects

Adam R. Kosiorek, Hyunjik Kim|arXiv (Cornell University)|2018. 06. 05.
Generative Adversarial Networks and Image Synthesis인용 수 94
한 줄 요약

sqair는 spatio-temporal 상태-공간 모델을 도입하여 AIR를 비디오로 확장하고, 프레임 간 움직이는 객체를 비지도 탐색, 추적 및 생성할 수 있게 하며, 가림 및 중첩 처리 개선을 제공합니다.

ABSTRACT

We present Sequential Attend, Infer, Repeat (SQAIR), an interpretable deep generative model for videos of moving objects. It can reliably discover and track objects throughout the sequence of frames, and can also generate future frames conditioning on the current frame, thereby simulating expected motion of objects. This is achieved by explicitly encoding object presence, locations and appearances in the latent variables of the model. SQAIR retains all strengths of its predecessor, Attend, Infer, Repeat (AIR, Eslami et. al., 2016), including learning in an unsupervised manner, and addresses its shortcomings. We use a moving multi-MNIST dataset to show limitations of AIR in detecting overlapping or partially occluded objects, and show how SQAIR overcomes them by leveraging temporal consistency of objects. Finally, we also apply SQAIR to real-world pedestrian CCTV data, where it learns to reliably detect, track and generate walking pedestrians with no supervision.

연구 동기 및 목표

  • 비지도학습 없이도 비디오에서 해석 가능한, 시간적으로 일관된 객체 표현을 학습하도록 자극한다.
  • AIR 프레임워크를 시퀀스로 확장하여 프레임 간 객체의 지속성, 외관, 동작을 모델링한다.
  • 장면에 들어오고 지속되거나 사라지는 객체를 추적하고 관리하기 위한 discovery-propagation 추론 메커니즘을 개발한다.
  • 합성 및 실제 데이터에서 객체 개수 추정, 재구성 및 다운스트림 작업 유용성의 향상을 입증한다.

제안 방법

  • Discovery와 Propagation 구성요소를 갖춘 시퀀스형 확률 모델로 AIR을 확장한다.
  • z^what, z^where, z^pres를 시간에 걸쳐 모델링하고, 기존 객체에는 propagate prior를, 새로운 객체에는 discovery prior를 사용한다.
  • 시간적 RNN과 관계 RNN을 사용해 설명 해소를 구현하고 시간에 따라 객체 간 상호 작용을 포착한다.
  • IWAE(Importance-Weighted Auto-Encoder) 목적함수로 학습하고 이산 변수에 대해 VIMCO 그래디언트 추정기를 사용한다.
  • 두 가지 아키텍처(mlp 및 conv-sqair)를 제공하고 AIR 및 vrnn 기반과 비교한다.
  • 시간에 걸쳐 객체의 존재 여부, 위치 및 외관을 명시적으로 인코딩하여 해석 가능성을 유지한다.

실험 결과

연구 질문

  • RQ1sqair가 비지도적으로 비디오 시퀀스에서 객체를 신뢰성 있게 발견, 추적 및 해석할 수 있는가?
  • RQ2프레임 단위 AIR와 비교했을 때 시간적 일관성을 도입하면 객체 개수 추정, 외관 보존 및 미래 프레임 생성이 향상되는가?
  • RQ3합성 moving MNIST 데이터와 실제 CCTV 보행자 데이터에서 likelihood, 재구성, 잠재 해석가능성 측면에서 sqair의 성능은 어떤가?
  • RQ4시간적 전파와 발견이 가림과 객체 중첩 처리에 어떤 영향을 미치는가?

주요 결과

  • sqair는 moving MNIST에서 conv-sqair가 6784.8 (log p_theta(x1:T)) 및 6923.8 (log p_theta(x1:T | z1:T))에 도달하고 KL 134.6으로 베이스라인보다 높은 주변 로그 가능도(IWAE bound)를 달성하며, 개수 추정 정확도는 0.9974, 합계 정확도는 0.9990이다.
  • mlp-sqair와 conv-sqair는 likelihood와 재구성 지표 모두에서 AIR 및 vrnn 베이스라인을 크게 능가하며, conv-sqair가 최상의 종합 점수를 달성한다.
  • sqair는 vrnn 및 AIR에 비해 KL 발산을 감소시켜 시간적으로 일관된 객체 표현을 통한 더 나은 압축 가능성을 시사한다.
  • sqair는 초기 프레임을 조건으로 타당한 미래 프레임을 생성하는 조건부 생성을 수행하고, 시간에 걸쳐 외관과 움직임을 보존한다.
  • 실제 CCTV 데이터에서 sqair는 보행자를 비지도 학습으로 탐지하고 추적하는 것을 학습하며, 합리적인 질적 재구성 및 조건부 생성 결과를 보이지만 데이터셋이 작을 경우 객체 개수 추정은 여전히 어려운 편이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.