Skip to main content
QUICK REVIEW

[논문 리뷰] Fast Video Salient Object Detection via Spatiotemporal Knowledge Distillation

Yi Tang, Yuan Li|arXiv (Cornell University)|2020. 10. 20.
Visual Attention and Saliency Detection참고 문헌 40인용 수 4
한 줄 요약

이 논문은 복잡한 순차 모듈을 사용하지 않고 높은 정확도를 달성하기 위해 시공간 지식 정복을 활용한 경량 비디오 주목 객체 탐지 네트워크를 제안한다. 공간 정복을 주목 객체 가이드드 특징 임bedding과 결합하고, 추론 프레임 특징 인코딩을 통한 시간 정복을 통해, 이 방법은 1 프레임당 0.01초의 추론 시간으로 최신 기술 성능(SOTA)을 달성한다.

ABSTRACT

Since the wide employment of deep learning frameworks in video salient object detection, the accuracy of the recent approaches has made stunning progress. These approaches mainly adopt the sequential modules, based on optical flow or recurrent neural network (RNN), to learn robust spatiotemporal features. These modules are effective but significantly increase the computational burden of the corresponding deep models. In this paper, to simplify the network and maintain the accuracy, we present a lightweight network tailored for video salient object detection through the spatiotemporal knowledge distillation. Specifically, in the spatial aspect, we combine a saliency guidance feature embedding structure and spatial knowledge distillation to refine the spatial features. In the temporal aspect, we propose a temporal knowledge distillation strategy, which allows the network to learn the robust temporal features through the infer-frame feature encoding and distilling information from adjacent frames. The experiments on widely used video datasets (e.g., DAVIS, DAVSOD, SegTrack-V2) prove that our approach achieves competitive performance. Furthermore, without the employment of the complex sequential modules, the proposed network can obtain high efficiency with 0.01s per frame.

연구 동기 및 목표

  • 광학 흐름이나 RNN과 같은 복잡한 순차 모듈에 의존하는 기존 비디오 주목 객체 탐지 모델의 높은 계산 비용 문제를 해결하기 위해.
  • 모델 복잡도와 추론 시간을 크게 줄이면서도 높은 탐지 정확도를 유지하기 위해.
  • 외부 순차 모듈 없이 지식 정복을 활용하여 강력한 시공간 특징을 추출하는 경량 네트워크를 개발하기 위해.
  • 공간 및 시간 지식 정복 구성 요소가 비디오 주목성에 대한 특징 표현을 향상시키는 데 효과적인지 검증하기 위해.

제안 방법

  • 주목 객체 가이드드 특징 임베딩 모듈을 도입하여 주목 영역에 집중함으로써 공간 특징 표현을 향상시킨다.
  • 교수자 유사 특징 맵에서 학생 네트워크로 지식을 전달함으로써 특징을 정교화하는 공간 지식 정복을 활용한다.
  • 이웃 프레임의 특징을 지도로 사용하여 현재 프레임의 특징 학습을 안내하는 시간 지식 정복을 제안한다.
  • 상호 주의 블록을 사용한 추론 프레임 특징 인코딩 모듈을 도입하여 이웃 프레임의 고수준 특징을 융합한다.
  • 균형 인자 α = 0.7을 사용하여 교차 엔트로피 손실과 정복 손실을 가중 조합하여 학습을 최적화한다.
  • 자신의 예측을 지도로 활용하여 자기 정복(self-distillation)을 적용함으로써 외부 교수자 모델이 필요로 하는 양을 줄인다.

실험 결과

연구 질문

  • RQ1지식 정복이 복잡한 순차 모듈 없이도 모델 복잡도를 줄이면서 정확도를 유지하는 데 효과적으로 적용될 수 있는가?
  • RQ2광학 흐름이나 RNN을 사용하지 않고도 경량 네트워크에서 효과적으로 시공간 특징을 학습할 수 있는가?
  • RQ3이웃 프레임에서 정보를 어떻게 인코딩하고 전달하여 시간 모델링을 향상시킬 수 있는가?
  • RQ4교차 엔트로피 손실과 정복 손실 간의 균형이 최종 성능에 어떻게 영향을 미치는가?

주요 결과

  • 제안된 방법은 DAVIS 데이터셋에서 F-측정값 0.883과 MAE 0.022를 기록하여 순차 모듈이 없는 기준 모델보다 뛰어난 성능을 보였다.
  • 공간 지식 정복을 추가함으로써 F-측정값은 1.9% 향상되고 MAE는 1.4% 감소하였다.
  • 특히 'Multiply' 연산 또는 상호 주의를 사용한 추론 프레임 특징 인코딩을 통한 시간 정복은 성능을 크게 향상시켜 F-측정값 0.882~0.883을 달성하였다.
  • 손실 가중치의 최적 균형 인자 α는 0.7이며, 이는 교차 엔트로피 손실과 정복 손실 간의 최적의 트레이드오프를 제공하였다.
  • 추론 시간은 1 프레임당 단지 0.01초로 단축되어 경쟁적인 정확도를 유지하면서도 높은 효율성을 입증하였다.
  • 테스트 시에는 추론 프레임 특징 인코딩 모듈을 제거해도 성능 저하가 없었으며, 이는 추론 속도 향상에 기여하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.