Skip to main content
QUICK REVIEW

[논문 리뷰] Self-supervised Video Object Segmentation by Motion Grouping

Charig Yang, Hala Lamdouar|arXiv (Cornell University)|2021. 04. 15.
Advanced Vision and Imaging참고 문헌 88인용 수 6
한 줄 요약

이 논문은 광학 흐름을 유일한 입력으로 사용하여 움직임이 유사한 픽셀을 그룹화해 전경 및 배경 레이어로 분할하는 자기지도 학습 영상 객체 분할 방법을 제안한다. 슬롯 어텐션 기반 트랜스포머 변형을 활용하여, DAVIS2016에서 최신 기준 성능을 달성하고, 캄ouflage가 어려운 MoCA 데이터셋에서 이전의 모든 자기지도 학습 방법을 뛰어넘는다. 이는 외관 기반 편향보다 움직임 신호의 핵심적 역할을 입증한다.

ABSTRACT

Animals have evolved highly functional visual systems to understand motion, assisting perception even under complex environments. In this paper, we work towards developing a computer vision system able to segment objects by exploiting motion cues, i.e. motion segmentation. We make the following contributions: First, we introduce a simple variant of the Transformer to segment optical flow frames into primary objects and the background. Second, we train the architecture in a self-supervised manner, i.e. without using any manual annotations. Third, we analyze several critical components of our method and conduct thorough ablation studies to validate their necessity. Fourth, we evaluate the proposed architecture on public benchmarks (DAVIS2016, SegTrackv2, and FBMS59). Despite using only optical flow as input, our approach achieves superior or comparable results to previous state-of-the-art self-supervised methods, while being an order of magnitude faster. We additionally evaluate on a challenging camouflage dataset (MoCA), significantly outperforming the other self-supervised approaches, and comparing favourably to the top supervised approach, highlighting the importance of motion cues, and the potential bias towards visual appearance in existing video segmentation models.

연구 동기 및 목표

  • 자신의 지도 학습된 마스크 없이 광학 흐름에서 유도된 움직임 신호에만 의존하는 자기지도 학습 영상 객체 분할 모델을 개발하는 것.
  • 특히 공통 운명 원칙을 기반으로 한 움직임 기반 인지적 군집화가 복잡한 시나리오에서 정확하고 효율적인 객체 분할을 가능하게 하는지 조사하는 것.
  • 외관 신호가 오도하는 경우(예: 캄ouflage)와 같은 도전적인 데이터셋에서 모델의 강인성을 평가하여, 외관 중심 모델의 한계를 부각하는 것.
  • 후처리 단계(예: CRF 또는 시간 평균화)를 피하고 경량 아키텍처를 사용함으로써 80fps 이상의 고속 추론을 달성하는 것.

제안 방법

  • 자기 주의(self-attention)를 슬롯 어텐션으로 대체한 수정된 트랜스포머 아키텍처를 사용하여, 유사한 운동을 가진 픽셀을 반복적으로 군집화하고 결합함으로써 별도의 객체 및 배경 레이어를 생성한다.
  • 다른 시간적 프레임 간격에서의 운동 군집 일관성을 유도하기 위해 광학 흐름에 대한 일관성 손실을 사용하는 자기지도 학습 프록시 작업을 통해 모델을 훈련시킨다.
  • 특히 저운동 또는 모호한 영역에서 안정적인 훈련을 유도하기 위해 확률 예측의 확신도를 높이기 위해 엔트로피 정규화 손실을 적용한다.
  • 경량 VGG 스타일 인코더를 사용하여 총 477만 개의 파라미터만을 가지며, CRF나 시간 평균화와 같은 계산 비용이 큰 후처리 단계 없이도 빠른 추론을 가능하게 한다.
  • RGB나 외관 특징이 아닌 광학 흐름을 유일한 입력으로 사용하여, 분할 성능에 대한 움직임 신호의 기여도를 고립적으로 평가한다.
  • 예측된 분할 마스크와 운동 필드로부터 입력 광학 흐름을 재구성하는 복원 목표를 사용해 엔드 투 엔드로 모델을 훈련시킨다.
Figure 1 : Segmenting camouflaged animals. Motion plays a critical role in augmenting the capability of our visual system for perceptual grouping in complex scenes – for example, in these sequences (MoCA dataset [ 39 ] ), the visual appearance (RGB images) is clearly uninformative. In this paper, we
Figure 1 : Segmenting camouflaged animals. Motion plays a critical role in augmenting the capability of our visual system for perceptual grouping in complex scenes – for example, in these sequences (MoCA dataset [ 39 ] ), the visual appearance (RGB images) is clearly uninformative. In this paper, we

실험 결과

연구 질문

  • RQ1광학 흐름 형태의 움직임 신호만으로도 자기지도 학습 방식에서 고성능 영상 객체 분할을 달성할 수 있는가?
  • RQ2외관 신호가 오도하는 경우(예: 캄ouflage 시나리오)에서 움직임 기반 분할 모델이 외관 기반 모델보다 어떻게 성능을 냈는가?
  • RQ3움직임 군집의 시간 일관성 강제 조건이 분할 정확도와 강인성에 얼마나 기여하는가?
  • RQ4레이블이 없는 상태에서 훈련된 경량 아키텍처가 실시간 추론 속도를 달성하면서도 최신 기준 성능을 유지할 수 있는가?

주요 결과

  • DAVIS2016에서 이전 최고의 자기지도 학습 방법(CIS)보다 9.1%p의 절대적 성능 향상을 달성하여, 지도 학습 모델에 근접한 성능을 확보했다.
  • MoCA 캄ouflage 데이터셋에서 모든 이전 자기지도 학습 방법을 뛰어넘었으며, 후처리 없이도 CIS보다 14%p 향상된 성능을 기록했다.
  • 소규모 해상도 입력에서 80fps 이상의 속도로 작동하여, CRF나 다중 코너 평균화와 같은 후처리를 사용하는 이전 방법들보다 약 10배 빠른 속도를 확보했다.
  • 제거 실험 결과, 시간 일관성 손실과 엔트로피 정규화 손실이 성능 향상에 핵심적인 역할을 하며, 둘 중 하나라도 제거되면 성능이 크게 저하됨을 확인했다.
  • MoCA에서의 성능은 외관 중심 모델의 한계를 부각시키며, 외관에 강하게 의존하는 최고의 지도 학습 모델인 COSNet조차도 모델의 성능에 뒤지지 않음을 보여준다.
  • 독립적으로 움직이는 다수의 객체가 존재할 경우 성능 저하가 발생함을 확인하였으며, 이는 전경 및 배경 레이어로 제한된 두 개의 슬롯 구조 때문이므로, 향후 연구에서는 동적 슬롯 탐지 기법이 필요하다.
Figure 2 : Pipeline. Our model takes optical flow $I_{t\rightarrow t+n}$ as input, and outputs a set of reconstruction and opacity layers. Specifically, it consists of three components: feature encoding, iterative binding, and decoding to layers, which are combined to reconstruct the input flow. To
Figure 2 : Pipeline. Our model takes optical flow $I_{t\rightarrow t+n}$ as input, and outputs a set of reconstruction and opacity layers. Specifically, it consists of three components: feature encoding, iterative binding, and decoding to layers, which are combined to reconstruct the input flow. To

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.