Skip to main content
QUICK REVIEW

[논문 리뷰] Segmenting Moving Objects via an Object-Centric Layered Representation

Junyu Xie, Weidi Xie|arXiv (Cornell University)|2022. 07. 05.
Video Surveillance and Tracking Methods인용 수 13
한 줄 요약

이 논문은 오직 광학 흐름을 입력으로 사용하여 영상에서 다수의 움직이는 물체를 세분하고 추적하는 물체 중심의 계층적 표현(OCLR) 모델을 제안한다. 트랜스포머 기반 아키텍처는 모달 마스크와 깊이 순서가 지정된 레이어를 예측하여 상호 가림을 견디는 강력한 성능을 발휘한다; 합성 데이터로만 훈련된 이 모델은 DAVIS, MoCA, SegTrack, FBMS-59에서 최신 기술 성능(SOTA)을 달성하였으며, 자기지도 학습 특징을 활용한 테스트 시 적응을 통해 추가로 성능 향상을 이룬다.

ABSTRACT

The objective of this paper is a model that is able to discover, track and segment multiple moving objects in a video. We make four contributions: First, we introduce an object-centric segmentation model with a depth-ordered layer representation. This is implemented using a variant of the transformer architecture that ingests optical flow, where each query vector specifies an object and its layer for the entire video. The model can effectively discover multiple moving objects and handle mutual occlusions; Second, we introduce a scalable pipeline for generating multi-object synthetic training data via layer compositions, that is used to train the proposed model, significantly reducing the requirements for labour-intensive annotations, and supporting Sim2Real generalisation; Third, we conduct thorough ablation studies, showing that the model is able to learn object permanence and temporal shape consistency, and is able to predict amodal segmentation masks; Fourth, we evaluate our model, trained only on synthetic data, on standard video segmentation benchmarks, DAVIS, MoCA, SegTrack, FBMS-59, and achieve state-of-the-art performance among existing methods that do not rely on any manual annotations. With test-time adaptation, we observe further performance boosts.

연구 동기 및 목표

  • 서로 가림을 겪는 상황에서도 영상 내에서 다수의 움직이는 물체를 탐지하고 추적하며 세분화할 수 있는 모델을 개발하는 것.
  • 외관 특징이나 수동 애너테이션에 의존하지 않고도 물체의 지속성과 시간에 따른 형태 일관성을 유지하는 것.
  • 비용이 많이 드는 인간 애너테이션 데이터에 대한 의존도를 줄이기 위해 유연하게 확장 가능한 합성 데이터셋으로만 훈련하는 것.
  • 오직 광학 흐름을 입력으로 사용하여 도메인 간 편차 문제를 피하고 강력한 Sim2Real 일반화를 달성하는 것.
  • 깊이 순서가 지정된 레이어링을 통해 오직 광학 흐름에서만 아모달 마스크 예측을 효과적으로 학습할 수 있는지 입증하는 것.

제안 방법

  • OCLR 모델은 각 물체의 완전한(아모달) 형태와 깊이 순서가 지정된 레이어를 예측하기 위해 학습 가능한 쿼리 벡터를 사용하는 트랜스포머 기반 아키텍처를 사용한다.
  • 각 쿼리 벡터는 물체의 전체 형태와 깊이 순서가 지정된 레이어를 인코딩하여 가림 상황에서도 일관된 표현을 가능하게 한다.
  • 모델는 실제 세계의 다양성을 시뮬레이션하기 위해 변형되는 물체, 움직이는 카메라, 비정적 배경의 조합을 통해 생성된 합성 데이터셋으로 훈련된다.
  • 깊이 순서가 지정된 레이어링 메커니즘은 가림 정보를 활용하여 아모달 예측에서 모달(가시) 마스크를 재구성한다.
  • 테스트 시 적응은 자기지도 학습 DINO 모델에서 추출한 외관 특징을 통합하여 실제 데이터에서의 성능을 추가로 향상시킨다.
  • 모델은 광학 흐름의 비연속성을 활용해 물체 경계를 탐지하고, 부분적인 가림에도 시간에 따른 일관성을 학습한다.

실험 결과

연구 질문

  • RQ1오직 합성 광학 흐름 데이터로만 훈련된 모델이 아모달 마스크를 사용해 다수의 움직이는 물체를 탐지하고 세분화할 수 있는가?
  • RQ2이러한 모델이 부분적 및 상호 가림 상황에서도 물체의 지속성과 시간에 따른 형태 일관성을 유지할 수 있는가?
  • RQ3정규화 없이도 광학 흐름 전용 접근 방식이 실제 영상 세분화 벤치마크에 효과적으로 일반화되는가?
  • RQ4자기지도 학습 외관 특징을 활용한 테스트 시 적응이 실제 데이터에서의 성능 향상에 얼마나 기여하는가?
  • RQ5계층적이고 물체 중심의 표현 방식이 광학 흐름의 가림 패턴에서 깊이 순서를 추론할 수 있는가?

주요 결과

  • OCLR 모델은 합성 데이터로만 훈련된 상태에서 DAVIS, MoCA, SegTrack, FBMS-59 벤치마크에서 최신 기술 성능을 달성하였으며, DAVIS, MoCA, SegTrackv2에서 각각 mIoU 점수 55.1, 54.5, 55.7을 기록하였다.
  • DINO 특징을 활용한 테스트 시 적응을 거친 후, DAVIS에서 mIoU 64.4, MoCA에서 65.2, SegTrackv2에서 63.6을 기록하여 여러 지도 학습 방법을 초월하였다.
  • 모델는 물체가 장기간 가려져 있어도 아모달 마스크의 일관성을 유지하여 물체 지속성을 효과적으로 학습하였다.
  • 모델는 광학 흐름의 가림 패턴에서 정확한 깊이 순서를 예측하여 모달 마스크의 정확한 레이어 조합을 가능하게 하였다.
  • 합성 데이터 생성 파이프라인은 다수의 변형되는 물체, 겹치는 운동, 카메라 이동 등의 실제 세계의 변형을 효과적으로 커버하였다.
  • 합성 데이터에서 실제 데이터로의 일반화가 뛰어나, 오직 광학 흐름을 유일한 입력 모odal로 사용함으로써 Sim2Real 갭이 최소화되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.