Skip to main content
QUICK REVIEW

[논문 리뷰] A Single Stream Network for Robust and Real-time RGB-D Salient Object Detection

Xiaoqi Zhao, Lihe Zhang|arXiv (Cornell University)|2020. 07. 14.
Visual Attention and Saliency Detection참고 문헌 49인용 수 19
한 줄 요약

이 논문은 새로운 깊이 향상 이중 주의 모듈(DEDA)과 피라미드형 주의 특징 추출(PAFE)을 통해 깊이 맵을 조기에 및 중간에 융합하는 단일 스트림, 경량, 실시간 RGB-D 주목 객체 검출 네트워크를 제안한다. 모델은 384×384 이미지에서 55.5%의 파라미터 감소와 32 FPS의 추론 속도를 달성하며, 다양한 벤치마크에서 기존 방법들을 능가하는 최신 기술 수준의 성능을 보인다.

ABSTRACT

Existing RGB-D salient object detection (SOD) approaches concentrate on the cross-modal fusion between the RGB stream and the depth stream. They do not deeply explore the effect of the depth map itself. In this work, we design a single stream network to directly use the depth map to guide early fusion and middle fusion between RGB and depth, which saves the feature encoder of the depth stream and achieves a lightweight and real-time model. We tactfully utilize depth information from two perspectives: (1) Overcoming the incompatibility problem caused by the great difference between modalities, we build a single stream encoder to achieve the early fusion, which can take full advantage of ImageNet pre-trained backbone model to extract rich and discriminative features. (2) We design a novel depth-enhanced dual attention module (DEDA) to efficiently provide the fore-/back-ground branches with the spatially filtered features, which enables the decoder to optimally perform the middle fusion. Besides, we put forward a pyramidally attended feature extraction module (PAFE) to accurately localize the objects of different scales. Extensive experiments demonstrate that the proposed model performs favorably against most state-of-the-art methods under different evaluation metrics. Furthermore, this model is 55.5\% lighter than the current lightest model and runs at a real-time speed of 32 FPS when processing a $384 imes 384$ image.

연구 동기 및 목표

  • 이중 스트림 RGB-D 네트워크의 한계를 해결하기 위해, 모odal 간 불일치로 인한 높은 파라미터 수와 낮은 일반화 성능을 개선하고자 한다.
  • 주목 객체 검출에서 깊이 맵을 단순한 모odal로 사용하는 것 외에도 주의 지도를 위한 공간적 사전 지식으로 활용하여 특징의 구분 능력을 향상시키고자 한다.
  • 고정밀도를 유지하면서도 실시간 추론 속도와 모델 크기를 줄이는 가벼운 아키텍처를 설계하고자 한다.
  • 다양한 척도의 특징 표현을 향상시키기 위해 다중 수신장 특징 간 공간 상관관계를 모델링하는 피라미드형 주의 특징 추출 모듈을 설계하고자 한다.

제안 방법

  • 초기 융합을 가능하게 하기 위해 4채널 입력(RGB + 깊이)을 사용하는 단일 스트림 인코더를 설계하였으며, ImageNet 사전 훈련 가중치와 새로운 초기화 전략을 활용해 훈련 안정성을 향상시켰다.
  • 깊이 향상 이중 주의 모듈(DEDA)은 두 개의 병렬 브랜치에서 마스크 지도 주의와 깊이 지도 주의를 적용하여 전경-배경 혼동을 억제하고 대trast를 향상시켰다.
  • 피라미드형 주의 특징 추출(PAFE) 모듈은 다중 수신장 특징 간 공간 상관관계를 계산하여 정확한 국소화를 위한 맥락 표현을 향상시켰다.
  • 초기 융합을 위해 원소별 덧셈과 4채널 연결을 사용하였으며, 후자가 기준 모델 대비 뚜렷한 성능 향상을 보였다.
  • 디코더는 깊이와 마스크 사전 지식에 의해 지도되는 이중 브랜치 주의를 활용하여 전경 및 배경 예측을 동시에 최적화한다.
  • 사전 훈련된 ImageNet 백본과 4채널 입력을 사용할 경우 훈련을 안정화시키기 위해 새로운 초기화 방법을 도입하였다.

실험 결과

연구 질문

  • RQ1단일 스트림 아키텍처가 모델 복잡도를 줄이면서도 이중 스트림 네트워크를 효과적으로 대체할 수 있는가?
  • RQ2깊이 맵을 단순한 특징 연결 외에 주의 메커니즘 향상에 어떻게 활용할 수 있는가?
  • RQ3깊이 지도 주의 메커니즘이 복잡한 환경에서 전경-배경 구분 능력을 어느 정도 향상시킬 수 있는가?
  • RQ4피라미드형 주의 특징 추출 모듈은 계산 비용을 크게 증가시키지 않으면서도 다중 척도 객체 국소화 성능을 향상시킬 수 있는가?
  • RQ5실시간 RGB-D 주목성 검출에서 모델 효율성, 정확도, 추론 속도 간의 상호 상충 관계는 어떠한가?

주요 결과

  • 제안된 모델은 현재 가장 가벼운 모델 대비 55.5%의 모델 크기 감소를 달성하였으며, VGG-16 백본을 사용할 경우 단지 106.7 MB의 크기를 가진다.
  • 384×384 이미지에서 32 FPS의 속도로 실시간 추론을 구현하였다.
  • RGBD135 데이터셋에서 기준 모델인 Cat He 방법 대비 MAE에서 16.36% 향상되고, Fβ^mean에서 5.44% 향상되었다.
  • 깊이 향상 이중 주의 모듈(DEDA)은 RGBD135에서 마스크 지도 주의보다 Fβ^max에서 2.1% 향상되고, Fβ^mean에서 1.8% 향상되었다.
  • 피라미드형 주의 특징 추출(PAFE) 모듈은 FLOPs(4.00G vs. 3.86G)와 파라미터 수(7.07M vs. 6.82M)에서 매우 미미한 증가로 ASPP를 능가하는 성능을 보였다.
  • 시각적 결과에서 DEDA는 저대비 및 혼잡한 환경에서 전경 및 배경 영역의 오분류 오류를 효과적으로 수정하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.