Skip to main content
QUICK REVIEW

[논문 리뷰] Semi-Supervised Video Salient Object Detection Using Pseudo-Labels

Pengxiang Yan, Guanbin Li|arXiv (Cornell University)|2019. 08. 12.
Visual Attention and Saliency Detection참고 문헌 16인용 수 10
한 줄 요약

이 논문은 광학 흐름과 희소 인간 주석을 사용하여 고해상도 픽셀 수준의 가짜 레이블을 생성하는 준지도 학습 비디오 주목 객체 검출 프레임워크를 제안한다. 이로 인해 실제 레이블의 약 20%만으로도 최신 기술 수준의 성능을 달성할 수 있다. 이 방법은 공간-시간 일관성을 활용하기 위해 잔차 보정 네트워크와 비국소적으로 향상된 순환 모듈을 결합한다. 이는 DAVIS, FBMS, VOS 벤치마크에서 완전히 지도 학습 기반 최신 기술 수준의 방법들을 능가한다.

ABSTRACT

Deep learning-based video salient object detection has recently achieved great success with its performance significantly outperforming any other unsupervised methods. However, existing data-driven approaches heavily rely on a large quantity of pixel-wise annotated video frames to deliver such promising results. In this paper, we address the semi-supervised video salient object detection task using pseudo-labels. Specifically, we present an effective video saliency detector that consists of a spatial refinement network and a spatiotemporal module. Based on the same refinement network and motion information in terms of optical flow, we further propose a novel method for generating pixel-level pseudo-labels from sparsely annotated frames. By utilizing the generated pseudo-labels together with a part of manual annotations, our video saliency detector learns spatial and temporal cues for both contrast inference and coherence enhancement, thus producing accurate saliency maps. Experimental results demonstrate that our proposed semi-supervised method even greatly outperforms all the state-of-the-art fully supervised methods across three public benchmarks of VOS, DAVIS, and FBMS.

연구 동기 및 목표

  • 완전히 지도 학습 기반 비디오 주목 객체 검출의 높은 주석 비용을 줄이기 위해 희소 인간 주석과 가짜 레이블을 활용한다.
  • 운동 인식 가짜 레이블 생성을 통해 주목성 예측의 시간적 일관성과 경계 정확도를 향상시킨다.
  • 추가 학습 없이도 비지도 비디오 객체 분할 작업에 일반화할 수 있는 프레임워크를 개발한다.
  • 광학 흐름과 보정 네트워크를 통해 생성된 가짜 레이블이 완전히 지도 학습 기반 기준을 초월할 수 있음을 검증한다.

제안 방법

  • 고해상도 주목성 맵을 생성하기 위해 업샘플링 기반 보정을 갖춘 잔차 보정 네트워크인 RCRNet을 제안한다.
  • 공간적·시간적 장거리 의존성을 향상시키기 위해 비국소적으로 향상된 순환(NER) 모듈을 도입한다.
  • 프레임 간 광학 흐름 추정을 위해 FlowNet 2.0을 사용하여 희소 진짜 레이블의 운동 유도 전파를 수행한다.
  • 광학 흐름을 사용해 인접 주석을 왜곡하고, 수정된 RCRNet에서 RGB 및 운동 특징과 융합하여 가짜 레이블을 생성한다.
  • 공간적·시간적 모델링을 향상시키기 위해 희소 진짜 레이블과 흐름 유도 가짜 레이블을 동시에 사용해 모델을 엔드 투 엔드로 훈련시킨다.
  • 세밀한 세부 사항을 유지하고 기울기 소실을 줄이기 위해 다중 해상도 감시와 스킵 연결을 활용한다.

실험 결과

연구 질문

  • RQ1희소 주석과 광학 흐름에서 생성된 가짜 레이블이 비디오 주목 객체 검출 성능을 향상시킬 수 있는가?
  • RQ2제안된 흐름 유도 가짜 레이블 생성 방식이 경계 세부 사항과 시간적 일관성을 얼마나 효과적으로 유지하는가?
  • RQ3진짜 레이블의 약 20%만으로 훈련된 준지도 학습 모델이 완전히 지도 학습 기반 최신 기술 수준의 방법을 능가할 수 있는가?
  • RQ4비국소적으로 향상된 순환 모듈이 주목성 예측에서 공간-시간 일관성을 얼마나 향상시키는가?
  • RQ5제안된 프레임워크는 비지도 비디오 객체 분할 작업에 일반화되는가?

주요 결과

  • DAVIS 벤치마크에서 제안된 방법은 평균 F-측정치 0.861을 달성하여 모든 완전히 지도 학습 기반 최신 기술 수준의 방법을 능가한다.
  • FBMS 데이터셋에서 이 방법은 재결합 지수(Jaccard index) 75.9%를 기록하여 두 번째로 우수한 방법(LVO, 65.1%)을 크게 앞서며 성능을 뛰어넘었다.
  • 제거 실험 결과, 가짜 레이블 생성 덕분에 기준 모델 대비 F-측정치가 0.026 향상되었으며(0.821 대비 0.847), 성능 향상이 확인되었다.
  • 비국소적으로 향상된 순환 모듈은 표준 ConvGRU 기준 대비 F-측정치를 0.004 향상시켜 장거리 의존성 모델링의 효과성을 입증했다.
  • 비지도 비디오 객체 분할 작업에서 최신 기술 수준의 성능을 달성하였으며, DAVIS에서 Jaccard 점수 74.7, FBMS에서 75.9를 기록하여 강력한 일반화 능력을 보였다.
  • 이 방법은 완전히 지도 학습 기반 방법에서 사용하는 진짜 레이블의 약 20%만으로도 충분하여 주석 비용을 크게 절감할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.