Skip to main content
QUICK REVIEW

[논문 리뷰] Self-supervised Video Object Segmentation

Fangrui Zhu, Li Zhang|arXiv (Cornell University)|2020. 06. 22.
Video Surveillance and Tracking Methods참고 문헌 26인용 수 8
한 줄 요약

이 논문은 새로운 메모리 메커니즘을 통해 장기적 대응 매칭을 향상시키고 추론 중에 온라인 적응을 도입하여 트래커 드리프트를 완화하는 자기지도 학습 영상 객체 분할 방법을 제안한다. 오직 100개의 원본 영상 클립(11분)만을 사용하여 DAVIS-2017과 YouTube-VOS에서 최신 기준 성능을 달성하며, 수백만 개의 애너테이션으로 훈련된 많은 지도 학습 방법들을 능가한다.

ABSTRACT

The objective of this paper is self-supervised representation learning, with the goal of solving semi-supervised video object segmentation (a.k.a. dense tracking). We make the following contributions: (i) we propose to improve the existing self-supervised approach, with a simple, yet more effective memory mechanism for long-term correspondence matching, which resolves the challenge caused by the dis-appearance and reappearance of objects; (ii) by augmenting the self-supervised approach with an online adaptation module, our method successfully alleviates tracker drifts caused by spatial-temporal discontinuity, e.g. occlusions or dis-occlusions, fast motions; (iii) we explore the efficiency of self-supervised representation learning for dense tracking, surprisingly, we show that a powerful tracking model can be trained with as few as 100 raw video clips (equivalent to a duration of 11mins), indicating that low-level statistics have already been effective for tracking tasks; (iv) we demonstrate state-of-the-art results among the self-supervised approaches on DAVIS-2017 and YouTube-VOS, as well as surpassing most of methods trained with millions of manual segmentation annotations, further bridging the gap between self-supervised and supervised learning. Codes are released to foster any further research (https://github.com/fangruizhu/self_sup_semiVOS).

연구 동기 및 목표

  • 장애물에 의한 가림, 빠른 운동, 물체 재등장으로 인해 발생하는 자기지도 학습 영상 객체 분할에서의 트래커 드리프트 문제를 해결하기 위해.
  • 특징 전파를 위한 더 효과적인 메모리 메커니즘을 도입하여 장기적 대응 매칭을 향상시키기 위해.
  • 자기지도 표현 학습에서의 효율성을 입증함으로써 지도 학습 애너테이션에 대한 의존도를 줄이기 위해.
  • 밀도 있는 영상 객체 추적에서 자기지도 학습 방법과 완전히 지도 학습 방법 간의 성능 격차를 좁히기 위해.

제안 방법

  • 쌍별 대응 매칭을 장기적 시간적 맥락으로 확장하는 메모리 메커니즘을 제안하여 물체가 사라지거나 재등장할 경우에도 강건성을 향상시킨다.
  • 추론 중에 임의로 초기화된 외관 모델을 오류 예측에 기반해 훈련시켜 전파된 마스크를 보정하는 온라인 적응 모듈을 도입한다.
  • 딥 네트워크가 노이즈보다 데이터 규칙성을 더 빨리 학습한다는 인덕티브 바이어스를 활용하여 잘못된 마스크 전파에 대한 과적합을 줄인다.
  • 자기지도 대비 학습을 통해 오직 100개의 원본 영상 클립(11분) 또는 100장의 정적 이미지로 강력한 추적 모델을 훈련시킨다.
  • 광학적 오차를 최소화하고 프레임 간 사이클 일관성을 최대화하기 위해 시아미즈 유사 네트워크와 특징 매칭 손실을 사용한다.
  • 다양한 기준 프레임의 특징을 저장하고 검색할 수 있는 메모리 백업을 활용하여 강력한 장거리 대응 매칭을 가능하게 한다.

실험 결과

연구 질문

  • RQ1인간이 애너테이션한 마스크가 전혀 없이 자기지도 학습 방법이 영상 객체 분할에서 최신 기준 성능을 달성할 수 있는가?
  • RQ2메모리 메커니즘이 객체 추적을 위한 장기적 대응 매칭 향상에 얼마나 효과적인가?
  • RQ3추론 중 온라인 적응이 장애물과 빠른 운동으로 인한 트래커 드리프트를 줄이는 데 효과적인가?
  • RQ4자기지도 학습은 얼마나 효율적인가? 최소한의 데이터로도 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ5밀도 있는 영상 객체 추적에서 의미적 이해가 핵심 역할을 하는가, 아니면 저수준 통계만으로도 충분한가?

주요 결과

  • 제안된 방법은 DAVIS-2017에서 J&F 점수 70.7, YouTube-VOS에서 67.3을 기록하여 이전의 모든 자기지도 학습 방법을 능가한다.
  • 두 벤치마크에서 모두 수백만 개의 애너테이션 프레임으로 훈련된 많은 완전 지도 학습 모델보다도 성능이 뛰어나다.
  • 예측되지 않은 카테고리로의 일반화 성능이 뛰어나며, YouTube-VOS에서 예측되지 않은 카테고리에서 J&F 점수 67.9를 기록했고 성능 저하 없이 유지된다.
  • 오직 100개의 원본 영상 클립(11분)으로 훈련해도 더 큰 데이터셋으로 훈련된 모델들과 비교해 유사한 성능을 달성한다.
  • 온라인 적응 모듈은 특히 장애물과 운동 불연속성 상황에서 트래커 드리프트를 크게 줄인다.
  • 메모리 메커니즘은 장기적 대응 매칭을 강력하게 가능하게 하여 물체가 사라졌다가 재등장할 경우 발생하는 문제를 해결한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.