Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Selective Mutual Attention and Contrast for RGB-D Saliency Detection

Nian Liu, Ni Zhang|arXiv (Cornell University)|2020. 10. 12.
Visual Attention and Saliency Detection참고 문헌 47인용 수 5
한 줄 요약

이 논문은 RGB-D 색채도 객체 검출을 위한 새로운 상호 주의 메커니즘을 제안하며, 크로스모달 비국소 주의를 활용하여 RGB와 깊이 특징 간의 고차원, 삼중선형 특징 상호작용을 가능하게 한다. 한 모odal의 주의를 이용해 다른 모달에서의 맥락 전파를 안내하고, 대비 학습과 선택적 깊이 재가중을 통합함으로써, 새로운 대규모 고품질 RGB-D 데이터셋 ReDWeb-S를 활용하여 실제 환경 장면에서 뚜렷한 성능 향상을 이룬 SMAC 모델이 여러 벤치마크에서 최신 기준 성능을 달성한다.

ABSTRACT

How to effectively fuse cross-modal information is the key problem for RGB-D salient object detection. Early fusion and the result fusion schemes fuse RGB and depth information at the input and output stages, respectively, hence incur the problem of distribution gap or information loss. Many models use the feature fusion strategy but are limited by the low-order point-to-point fusion methods. In this paper, we propose a novel mutual attention model by fusing attention and contexts from different modalities. We use the non-local attention of one modality to propagate long-range contextual dependencies for the other modality, thus leveraging complementary attention cues to perform high-order and trilinear cross-modal interaction. We also propose to induce contrast inference from the mutual attention and obtain a unified model. Considering low-quality depth data may detriment the model performance, we further propose selective attention to reweight the added depth cues. We embed the proposed modules in a two-stream CNN for RGB-D SOD. Experimental results have demonstrated the effectiveness of our proposed model. Moreover, we also construct a new challenging large-scale RGB-D SOD dataset with high-quality, thus can both promote the training and evaluation of deep models.

연구 동기 및 목표

  • 초기의 결과 기반 및 단순한 특징 융합 방식이 분포 갭 또는 부족한 크로스모달 상호작용으로 인해 약점이 있음을 해결하기 위해.
  • RGB와 깊이 모달 간의 보완적 주의 신호를 활용하여 고차원, 삼중선형 크로스모달 상호작용 메커니즘을 개발하기 위해.
  • 저품질 깊이 데이터의 부정적 영향을 줄이기 위해 신뢰도 기반으로 깊이 특징을 재가중하는 선택적 주의 메커니즘을 설계하기 위해.
  • 실제 환경에서의 색채도 검출 모델을 보다 효과적으로 훈련하고 평가하기 위해, 새로운 대규모 고품질 RGB-D 벤치마크 데이터셋(ReDWeb-S)을 구축하기 위해.
  • 상호 주의와 대비 학습을 하나의 종단간 훈련 가능한 프레임워크로 통합하여 성능 향상을 이끌어내기 위해.

제안 방법

  • 비국소 주의를 한 모달(예: 깊이)에서 추출한 후 다른 모달(예: RGB)에서 장거리 맥락 전파를 안내하는 상호 주의 메커니즘을 제안하며, 이는 고차원 크로스모달 상호작용을 가능하게 한다.
  • 서로 다른 주의 맵에서 유도된 양성 및 음성 샘플을 대비하여 대비 학습 모듈을 도입하여 특징의 구분 능력을 향상시킨다.
  • 신뢰도 기반으로 깊이 특징을 재가중하는 선택적 주의 메커니즘을 설계하여 저품질 깊이 맵에서 유도되는 노이즈를 감소시킨다.
  • 종단간 훈련 및 추론을 위해 RGB-D 색채도 검출에 적합한 이중 스트림 U-Net 아키텍처에 제안된 SMAC 모듈을 통합한다.
  • 비국소 네트워크를 사용해 공간 위치 간의 쿼리-키 유사도를 계산함으로써 장거리 맥락적 의존성을 포착하고 전파할 수 있도록 한다.
  • RGB와 깊이 특징 간의 고차원 상호작용을 모델링하기 위해 삼중선형 풀링을 활용하여 복잡한 크로스모달 관계를 포착한다.

실험 결과

연구 질문

  • RQ1비국소 맥락 전파 기반의 크로스모달 상호 주의가 표준 특징 융합 방식을 초월해 RGB-D 색채도 검출 성능을 크게 향상시킬 수 있는가?
  • RQ2서로 주의 맵에서 유도된 대비 학습을 통합함으로써 RGB-D 색채도 모델의 특징 구분 능력은 어떻게 향상되는가?
  • RQ3선택적 깊이 특징 재가중이 저품질 깊이 데이터로 인한 성능 저하를 어느 정도 완화하는가?
  • RQ4고품질 깊이 맵을 포함한 새로운 대규모 실생활 RGB-D 데이터셋이 최신 기준 성능 모델의 일반화 능력과 성능 향상에 기여하는가?
  • RQ5상호 주의, 대비 학습, 선택적 깊이 가중치를 통합한 통합 모델이 다양한 벤치마크에서 기존 최신 기준 방법들을 초월할 수 있는가?

주요 결과

  • 제안된 SMAC 모델은 9개 벤치마크 데이터셋 중 8개에서 이전 최신 기준 방법들을 능가하며, 특히 복잡한 실생활 장면에서 뚜렷한 성능 향상을 보였다.
  • 새로운 ReDWeb-S 데이터셋으로 훈련된 SMAC* 버전은 대부분의 데이터셋에서 SMAC보다 뛰어난 성능을 보였으며, 특히 실생활 장면을 포함한 SIP 데이터셋에서 두드러진 성능 향상을 보였다.
  • 근접 거리의 단순한 물체에 초점을 맞춘 RGBD135 및 DUTLF-Depth와 같은 데이터셋에서는 SMAC가 SMAC*보다 뛰어난 성능을 보였으며, 이는 ReDWeb-S가 실생활 다양성을 추가함으로써 기존 데이터셋을 보완함을 시사한다.
  • NJUD + ReDWeb-S로 훈련한 평균 성능 순위(APR)는 2.72로, 모든 단일 및 이중 데이터셋 훈련 설정 중에서 가장 우수하여 ReDWeb-S의 상호보완적 가치를 입증한다.
  • 정성적 결과에서는 SMAC 및 SMAC*가 복잡한 장면, 작은 물체, 다중 물체, 먼 거리의 물체, 눈에 띄지 않는 물체 등 이전 방법이 실패하는 과제들에서도 성공적으로 색채도 객체를 탐지함을 보였다.
  • 절단 분석 결과 각 구성 요소인 상호 주의, 대비 학습, 선택적 주의가 최종 성능 향상에 기여하며, 특히 상호 주의가 가장 큰 영향을 미침을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.