Skip to main content
QUICK REVIEW

[논문 리뷰] Motion Guided Attention for Video Salient Object Detection

Haofeng Li, Guanqi Chen|arXiv (Cornell University)|2019. 09. 16.
Visual Attention and Saliency Detection참고 문헌 49인용 수 17
한 줄 요약

이 논문은 DAVIS 및 FBMS 벤치마크에서 0.022 MAE 및 0.902 maxF의 SOTA 성능을 달성하며, 이중 브랜치 아키텍처를 통해 운동 신호를 명시적으로 모델링하는 운동 유도 주의망을 제안한다. 한 브랜치는 정적 프레임에서 주목할 만한 객체를 검출하고, 다른 브랜치는 광학 흐름 이미지에서 운동 주목도를 검출한다. 이 방법은 외관 특징을 운동 주목도로 향상시키기 위해 새로운 운동 유도 주의 모듈을 사용한다.

ABSTRACT

Video salient object detection aims at discovering the most visually distinctive objects in a video. How to effectively take object motion into consideration during video salient object detection is a critical issue. Existing state-of-the-art methods either do not explicitly model and harvest motion cues or ignore spatial contexts within optical flow images. In this paper, we develop a multi-task motion guided video salient object detection network, which learns to accomplish two sub-tasks using two sub-networks, one sub-network for salient object detection in still images and the other for motion saliency detection in optical flow images. We further introduce a series of novel motion guided attention modules, which utilize the motion saliency sub-network to attend and enhance the sub-network for still images. These two sub-networks learn to adapt to each other by end-to-end training. Experimental results demonstrate that the proposed method significantly outperforms existing state-of-the-art algorithms on a wide range of benchmarks. We hope our simple and effective approach will serve as a solid baseline and help ease future research in video salient object detection. Code and models will be made available.

연구 동기 및 목표

  • 기존 방법에서 자주 간과되는, 객체 운동을 영상 주목할 만한 객체 검출에 효과적으로 통합하는 데 도전한다.
  • 광학 흐름 이미지에서 운동 주목도를 명시적으로 모델링하여 운동을 시각적 주의의 핵심 단서로 활용함으로써 주목도 검출을 향상시킨다.
  • 외관 및 운동 브랜치를 별도로 사전 훈련한 후 엔드 투 엔드 훈련을 수행하는 다중 작업 학습 프레임워크를 개발하여 특징 학습을 향상시킨다.
  • 운동 주목도를 사용해 외관 특징을 동적으로 주의하는 새로운 운동 유도 주의 모듈을 설계하여 특징 표현을 향상시킨다.
  • 복잡한 순환 구조가 필요 없이도 장거리 메모리 기반 모델을 능가하는 강력하고 단순한 베이스라인을 수립한다.

제안 방법

  • 이 방법은 이중 브랜치 네트워크를 사용한다: 하나의 브랜치는 정적 영상 SOD를 위한 RGB 프레임을 처리하고, 다른 브랜치는 운동 주목도 검출을 위한 광학 흐름 이미지를 처리한다.
  • 운동 유도 주의 모듈은 운동 브랜치의 주목도 맵을 사용해 외관 브랜치의 특징을 주의하고 향상시키며, 공간적 및 채널별 주의 메커니즘을 활용한다.
  • 이 주의 모듈은 잔차 학습을 통합하고 가벼운 구조로 설계되어 장기적인 시간적 메모리가 필요 없이 효율적인 특징 융합을 가능하게 한다.
  • 외관 브랜치는 정적 영상 SOD에서 사전 훈련되고, 운동 브랜치는 운동 주목도 검출에서 사전 훈련된 후 공동 최적화를 위해 엔드 투 엔드 훈련을 수행한다.
  • 복잡한 순환 단위(예: ConvLSTM)가 필요 없도록 이전 프레임의 단기적 맥락만을 사용한다.
  • 병합 전략으로서 연결, 원소별 곱셈, 덧셈을 평가하였으며, 최고의 성능은 MGA-tmc(에코더) 및 MGA-m(디코더) 모듈에서 달성되었다.

실험 결과

연구 질문

  • RQ1광학 흐름 이미지에서 운동 주목도를 명시적으로 모델링하면, 외관 기반 방법을 초월해 영상 주목할 만한 객체 검출 성능을 향상시킬 수 있는가?
  • RQ2주의 메커니즘을 사용해 운동 신호를 외관 기반 주목도 검출에 효과적으로 통합할 수 있는가?
  • RQ3엔드 투 엔드 훈련 이전에 외관 및 운동 브랜치를 별도로 사전 훈련하는 것이, 처음부터 공동 훈련하는 것보다 성능을 향상시키는가?
  • RQ4공간, 채널, 또는 병합된 주의 모듈 설계 중 어느 것이 운동 유도 특징 향상에서 가장 높은 성능을 낼 수 있는가?
  • RQ5단기적 시간 맥락만을 사용하는 가벼운 비순환 아키텍처가 장거리 메모리 기반 모델을 능가할 수 있는가?

주요 결과

  • 제안된 방법은 DAVIS 2017 벤치마크에서 0.022 MAE, 0.913 S-m, 0.902 maxF를 기록하여 이전 SOTA 방법을 초월하는 최고의 성능을 달성한다.
  • FBMS 벤치마크에서는 0.027 MAE, 0.907 S-m, 0.910 maxF를 기록하여 다양한 영상 데이터셋에 대한 강력한 일반화 능력을 입증한다.
  • 다중 작업 훈련 방식(Tma)은 단일 작업 사전 훈련 및 처음부터 엔드 투 엔드 훈련하는 것보다 우수하며, DAVIS에서는 maxF를 1.7% 향상시키고, FBMS에서는 1.9% 향상시킨다.
  • 에코더의 MGA-tmc 모듈과 디코더의 MGA-m 모듈이 가장 높은 성능을 기록하였으며, FBMS에서는 원소별 덧셈보다 0.8% 높은 maxF, DAVIS에서는 0.9% 높은 S-m 성능을 기록했다.
  • 제거 분석 결과, 운동 유도 주의 모듈이 연결이나 덧셈과 같은 단순 융합 전략보다 유의미하게 뛰어난 성능을 낸다.
  • 다중 주목할 만한 객체가 있는 영상에서 운동 신호가 덜 구분되는 경우에도, 외관과 운동 특징을 효과적으로 균형 잡아 강건한 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.