Skip to main content
QUICK REVIEW

[논문 리뷰] RGB-D Salient Object Detection with Cross-Modality Modulation and Selection

Chongyi Li, Runmin Cong|arXiv (Cornell University)|2020. 07. 14.
Visual Attention and Saliency Detection참고 문헌 45인용 수 10
한 줄 요약

이 논문은 RGB-D 색채도 객체 검출을 위한 새로운 네트워크를 제안하며, 교차 모odal 특징 조절(cmFM)과 적응형 특징 선택(AFS)을 통해 특징 표현을 향상시켜 정밀하고 가장자리 보존 성능을 갖춘 색채도 예측을 가능하게 한다. 통합된 cmMS 블록을 통해 조각별로 특징을 정교화하는 코arse-to-fine 방식으로 특징을 개선함으로써, 여섯 가지 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

We present an effective method to progressively integrate and refine the cross-modality complementarities for RGB-D salient object detection (SOD). The proposed network mainly solves two challenging issues: 1) how to effectively integrate the complementary information from RGB image and its corresponding depth map, and 2) how to adaptively select more saliency-related features. First, we propose a cross-modality feature modulation (cmFM) module to enhance feature representations by taking the depth features as prior, which models the complementary relations of RGB-D data. Second, we propose an adaptive feature selection (AFS) module to select saliency-related features and suppress the inferior ones. The AFS module exploits multi-modality spatial feature fusion with the self-modality and cross-modality interdependencies of channel features are considered. Third, we employ a saliency-guided position-edge attention (sg-PEA) module to encourage our network to focus more on saliency-related regions. The above modules as a whole, called cmMS block, facilitates the refinement of saliency features in a coarse-to-fine fashion. Coupled with a bottom-up inference, the refined saliency features enable accurate and edge-preserving SOD. Extensive experiments demonstrate that our network outperforms state-of-the-art saliency detectors on six popular RGB-D SOD benchmarks.

연구 동기 및 목표

  • 색채도 객체 검출에서 상보적인 RGB 및 깊이 특징을 효과적으로 통합하는 문제를 해결하기 위해.
  • 비일관되거나 노이즈가 많은 깊이 맵으로 인한 간섭을 줄이기 위해 교차 모달 관계를 더 견고하게 모델링하기 위해.
  • 다중 모달 맥락에서 공간적 및 채널 차원을 모두 고려해 색채도 관련 특징을 적응적으로 선택하기 위해.
  • 위치 및 가장자리 인식 주의 메커니즘을 통해 색채도 맵의 경계 정확도와 완전성을 향상시키기 위해.
  • 통합된 코어스-투-파인 정교화 파이프라인을 통해 여러 RGB-D SOD 벤치마크에서 최신 기술 수준 성능을 달성하기 위해.

제안 방법

  • 학습 가능한 조절을 통해 깊이 특징를 사전으로 활용하여 RGB 특징 표현을 향상시키는 교차 모달 특징 조절(cmFM) 모듈을 도입하며, 단순한 연결 또는 덧셈 방식을 피한다.
  • 다중 모달 공간적 특징의 게이트드 퓨전을 적용하면서 자기 모달 및 교차 모달 채널 주의를 모델링하여 동적 특징 가중치를 부여하는 적응형 특징 선택(AFS) 모듈을 제안한다.
  • 예측된 색채도 및 가장자리 맵을 사용해 주의를 안내하는 색채도 유도 위치-가장자리 주의(sg-PEA) 모듈을 활용하며, 색채도 영역과 가장자리를 강조한다.
  • cmFM, AFS, sg-PEA를 통합한 유일한 cmMS 블록을 구성하여 순차적인 조절, 선택, 주의 메커니즘을 통해 색채도 특징의 코어스-투-파인 정교화를 가능하게 한다.
  • 최종 색채도 맵의 정확도 및 가장자리 보존을 향상시키기 위해 바닥에서부터 특징 추론을 수행한다.
  • 전체 네트워크는 표준 감독 하에 엔드 투 엔드로 훈련되며, 더 나은 국소화를 위해 다중 척도 감독을 활용한다.

실험 결과

연구 질문

  • RQ1RGB 및 깊이 특징를 단순한 초기 또는 후기 융합을 넘어서 효과적으로 통합할 수 있는 방법은 무엇인가?
  • RQ2공간적 및 채널 차원에서 색채도 관련 특징을 적응적으로 선택하면, 노이즈가 많거나 비일관된 깊이 입력에서 성능 향상이 이루어지는가?
  • RQ3예측된 색채도 맵에 의해 안내되는 위치 및 가장자리 주의를 통합할 경우 경계 정확도 향상 정도는 어느 정도인가?
  • RQ4조절, 선택 및 정교화를 통합한 코어스-투-파인 모듈러 파이프라인은 기존의 RGB-D SOD 아키텍처를 능가하는가?
  • RQ5제안된 프레임워크는 다양한 벤치마크에서 일반화되어 최신 기술 수준 성능을 달성할 수 있는가?

주요 결과

  • cmFM, AFS, sg-PEA를 통합한 제안된 cmMS 블록은 여섯 가지 인기 있는 RGB-D SOD 벤치마크에서 최신 기술 수준 성능을 달성한다.
  • 절단 실험 결과, cmFM 모듈을 제거할 경우 성능 저하가 심각하게 나타나며, STEREO 데이터셋에서 $F_\beta$ 가 0.9084에서 0.8727로 감소한다.
  • AFS 모듈은 베이스라인 대비 성능 향상을 이룬다: 이를 제거하면 STEREO에서 $F_\beta$ 가 0.8990으로 떨어지며, 기존 채널 주의를 사용하는 경우는 미미한 향상에 그친다.
  • sg-PEA 모듈은 경계 정확도에 핵심적이다: 이를 제거하면 STEREO에서 $F_\beta$ 가 0.9057로 떨어지고, 가장자리 주의 구성 요소를 제거할 경우 경계가 흐려진다.
  • 전체 모델은 DUT-Test 데이터셋에서 $F_\beta$ 가 0.9328, MAE가 0.0366를 기록하며 이전의 SOTA 방법들을 능가한다.
  • 시각적 비교 결과, 제안된 방법은 CPFP 및 A2dele보다 더 완전하고 선명하며 가장자리 보존 성능이 뛰어난 색채도 맵을 생성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.