Skip to main content
QUICK REVIEW

[논문 리뷰] Mask Propagation Network for Video Object Segmentation

Jia Sun, Dongdong Yu|arXiv (Cornell University)|2018. 10. 24.
Visual Attention and Saliency Detection참고 문헌 10인용 수 8
한 줄 요약

이 논문은 광학 흐름 유도 마스크 워핑과 수정된 DeepLab v3+ 백본을 활용하여 프레임 간에 인스턴스 마스크를 전파하는 마스크 전파 네트워크(MPN)를 제안한다. 관심 영역(ROI) 패치에 집중하고, 손실된 인스턴스 복구를 위해 미세조정된 OSVOS 변종을 결합함으로써, DAVIS 2018에서 최신 기술 수준의 성능을 달성하였으며, 영역 재결합 지수 57.7%와 경계 F-측도 62.4%를 기록하였다.

ABSTRACT

In this work, we propose a mask propagation network to treat the video segmentation problem as a concept of the guided instance segmentation. Similar to most MaskTrack based video segmentation methods, our method takes the mask probability map of previous frame and the appearance of current frame as inputs, and predicts the mask probability map for the current frame. Specifically, we adopt the Xception backbone based DeepLab v3+ model as the probability map predictor in our prediction pipeline. Besides, instead of the full image and the original mask probability, our network takes the region of interest of the instance, and the new mask probability which warped by the optical flow between the previous and current frames as the inputs. We also ensemble the modified One-Shot Video Segmentation Network to make the final predictions in order to retrieve and segment the missing instance.

연구 동기 및 목표

  • 기존의 비디오 객체 분할 방법이 음영, 운동 변화 및 다중 인스턴스 추적 문제를 다루는 데에 한계를 보이는 것을 해결하기 위해.
  • 광학 흐름과 유도된 마스크 전파를 활용하여 시간적 일관성과 분할 정확도를 향상시키기 위해.
  • 손실된 인스턴스를 복구하기 위해 수정된 일회성 비디오 분할(OSVOS) 네트워크를 사용하기 위해.
  • DenseCRF를 통한 후처리를 통해 경계 정밀도를 향상시키기 위해.

제안 방법

  • 네트워크는 Xception 기반의 DeepLab v3+ 모델을 사용하여 이전 프레임의 마스크 확률 맵과 현재 프레임의 외관을 기반으로 현재 프레임의 마스크를 예측한다.
  • FlowNet 2.0에서 생성된 광학 흐름을 사용하여 이전 프레임의 마스크를 현재 프레임에 맞추기 위해 워핑한다.
  • 전체 해상도 입력 대신 각 인스턴스 주변의 관심 영역(ROI)을 자르는 방식을 사용하여 배경 노이즈를 줄이고 효율성을 향상시킨다.
  • 모델은 두 단계로 훈련된다: MSRA10K와 DAVIS 2017에서 사전 훈련한 후, 각 비디오 인스턴스별로 첫 번째 프레임의 마스크를 사용해 온라인 미세조정을 수행한다.
  • 스킵 연결을 갖춘 수정된 OSVOS 네트워크를 사용하여 전파 과정에서 손실된 인스턴스를 탐지하고 분할한다.
  • 최종 예측 결과는 경계 정밀도와 국소 세부 정보를 향상시키기 위해 DenseCRF를 사용해 정제한다.

실험 결과

연구 질문

  • RQ1광학 흐름 유도 마스크 전파가 비디오 객체 분할에서 시간적 일관성을 향상시키는가?
  • RQ2인스턴스별 관심 영역에 집중함으로써 분할 정확도 향상과 배경 간섭 감소가 가능한가?
  • RQ3마스크 전파와 일회성 학습을 융합한 하이브리드 접근 방식이 음영이나 운동 변화로 인해 손실된 인스턴스를 복구할 수 있는가?
  • RQ4DenseCRF를 통한 후처리가 비디오 분할에서 경계 정밀도 향상에 얼마나 기여하는가?

주요 결과

  • 제안된 방법은 DAVIS 2018 테스트 챌린지 세트에서 영역 재결합 지수 57.7%와 경계 F-측도 62.4%를 달성하였다.
  • Jaccard 및 F-측도 지표에서 TeamILC_RIL 및 Lixx와 같은 강력한 베이스라인을 모두 초월하였다.
  • ROI 자르기 기법이 모델 효율성 향상과 배경 관련 오류 감소에 크게 기여하였다.
  • 수정된 OSVOS 네트워크 통합으로 평균 27.2%의 손실된 인스턴스가 효과적으로 복구되었음을 감쇠 지표를 통해 확인하였다.
  • DenseCRF 정제로 인해 복잡하거나 모호한 영역에서 경계 세부 정보가 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.