Skip to main content
QUICK REVIEW

[논문 리뷰] Guess What Moves: Unsupervised Video and Image Segmentation by Anticipating Motion

Subhabrata Choudhury, Laurynas Karazija|arXiv (Cornell University)|2022. 05. 16.
Advanced Vision and Imaging인용 수 9
한 줄 요약

이 논문은 단일 이미지를 입력으로 사용하여 운동 패턴을 예측하도록 네트워크를 훈련시켜 영상 및 이미지 분할을 위한 새로운 비지도 학습 방법을 제안한다. 단순한 운동 패턴(예: 아핀 또는 이차형 유동)을 포함할 가능성이 높은 영역을 예측하는 사전 과제를 통해 분할을 감독함으로써, 객체가 정지해 있을 경우에도 객체를 탐지할 수 있도록 학습시키며, 영상 분할 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하고, 정지된 이미지의 새로운 객체에 대해서도 강력한 일반화 능력을 보여준다.

ABSTRACT

Motion, measured via optical flow, provides a powerful cue to discover and learn objects in images and videos. However, compared to using appearance, it has some blind spots, such as the fact that objects become invisible if they do not move. In this work, we propose an approach that combines the strengths of motion-based and appearance-based segmentation. We propose to supervise an image segmentation network with the pretext task of predicting regions that are likely to contain simple motion patterns, and thus likely to correspond to objects. As the model only uses a single image as input, we can apply it in two settings: unsupervised video segmentation, and unsupervised image segmentation. We achieve state-of-the-art results for videos, and demonstrate the viability of our approach on still images containing novel objects. Additionally we experiment with different motion models and optical flow backbones and find the method to be robust to these change. Project page and code available at https://www.robots.ox.ac.uk/~vgg/research/gwm.

연구 동기 및 목표

  • 운동 기반 분할의 정지된 객체에 대한 한계를 해결하기 위해 운동 신호와 외관 학습을 융합한다.
  • 지표 객체 애너테이션을 필요로 하지 않고 운동을 감독 신호로 사용하는 자기지도 학습 프레임워크를 개발한다.
  • 학습 중에 볼 수 없었던 새로운 객체를 포함한 정지된 이미지에 대해 모델의 제로샷 일반화를 가능하게 한다.
  • 운동 모델 및 옵티컬 플로우 백본의 변형에 대해 강건한 방법을 설계한다.
  • 비지도 영상 객체 분할 벤치마크에서 최신 기술 수준의 성능을 달성하면서도 이미지 분할에 대해서도 타당성을 유지한다.

제안 방법

  • 단일 이미지에서 단순한 운동 패턴(예: 아핀 또는 이차형 유동)을 포함할 가능성이 높은 영역을 예측하는 사전 과제를 통해 분할 네트워크를 훈련시킨다.
  • 모델이 추론 중에 직접 운동을 관찰하지 않더라도, 단일 입력 프레임의 옵티컬 플로우를 사용해 네트워크를 감독한다.
  • 훈련 손실을 매개변수화된 운동 모델 하에서 예측된 영역와 관측된 운동 패턴 간의 호환성 측도로 공식화한다.
  • 단일 이미지 환경에서의 모호성을 줄이기 위해 운동 예측 자체를 피하고 오직 운동 패턴의 공간적 지지 영역을 식별하는 데 집중한다.
  • 동일한 네트워크를 두 가지 모드로 적용한다: (1) 비지도 영상 분할를 위한 내부 학습, (2) 비지도 이미지 분할를 위한 전도 학습.
  • 예측 후에 CRF 정밀화를 통합하여 복잡한 시나리오에서 경계 정확도를 향상시킨다.

실험 결과

연구 질문

  • RQ1단일 이미지의 운동 패턴을 지도 신호로 사용하여 애너테이션 없이 객체 인식 표현을 학습할 수 있는가?
  • RQ2운동 신호로 훈련된 모델이 운동이 없는 정지된 이미지에서 새로운 객체를 분할할 수 있는가?
  • RQ3아핀 모델과 이차형 모델 간의 운동 모델 가정의 변화나 옵티컬 플로우 백본 아키텍처의 변화에 대해 이 방법은 얼마나 강건한가?
  • RQ4운동 패턴을 예측하는 것이 비지도 영상 객체 분할에서 최신 기술 수준의 성능을 달성하는 데 기여하는가?
  • RQ5이중적인 시나리오와 다양한 객체 카테고리가 포함된 복잡한 시나리오에서의 정지된 이미지에서도 높은 품질의 분할을 달성할 수 있는가?

주요 결과

  • DAVIS16 벤치마크에서 최신 기술 수준의 성능을 달성하여, 평균 IoU가 80.7% (M)이고 재현율이 95.7% (R)를 기록하며 이전의 비지도 방법들을 능가한다.
  • FBMS59 데이터셋에서 CRF 정밀화를 적용한 결과 평균 IoU가 80.7%를 기록하여 다양한 이미지 시퀀스에 대한 강력한 일반화 능력을 입증한다.
  • CUB 데이터셋에서 모델은 DAVIS, FBMS, STv2 등의 다양한 데이터셋으로 훈련된 후에도 다양한 자세와 배경을 가진 새를 성공적으로 분할한다.
  • 정지된 이미지에 대해서도 효과적으로 일반화되며, DUT-OMRON, DUTS, ECSSD 데이터셋에서 복잡한 시나리오(다중 배경 객체 포함)에서도 높은 품질의 분할을 달성한다.
  • 절단 실험 결과, 운동 모델 및 옵티컬 플로우 백본의 변화에 대해 강건하며, 다양한 설정에서도 일관된 성능을 보인다.
  • 실패 케이스는 주로 여러 개의 주목할 만한 객체가 존재하지만 오직 하나의 객체만 애너테이션된 경우에 발생하며, 평가 시 애너테이션의 모호성에 민감함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.