Skip to main content
QUICK REVIEW

[논문 리뷰] MTFNet: Mutual-Transformer Fusion Network for RGB-D Salient Object Detection.

Xixi Wang, Bo Jiang|arXiv (Cornell University)|2021. 12. 02.
Visual Attention and Saliency Detection참고 문헌 48인용 수 6
한 줄 요약

MTFNet은 정확한 특징 학습을 위한 집중형 특징 추출기(Focal Feature Extractor, FFE)와 동시에 내부 및 이종 모odal 특징 상호작용을 수행하는 상호 트랜스포머 융합(Mutual-Transformer Fusion, MTF) 모듈을 도입한 새로운 RGB-D 색채도 객체 검출 네트워크이다. 공동 모달 학습을 통해 보완적인 RGB 및 깊이 정보를 효과적으로 활용하여 여섯 개인 공개 벤치마크에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Salient object detection (SOD) on RGB-D images is an active problem in computer vision. The main challenges for RGB-D SOD problem are how to 1) extract the accurate features for RGB and Depth image data with clutter background or poor image quality and 2) explore the complementary information between RGB and Depth image data. To address these challenges, we propose a novel Mutual-Transformer Fusion Network (MTFNet) for RGB-D SOD. MTFNet contains two main modules, $i.e.$, Focal Feature Extractor (FFE) and Mutual-Transformer Fusion (MTF). FFE aims to extract the more accurate CNN features for RGB and Depth images by introducing a novel pixel-level focal regularization to guide CNN feature extractor. MTF is designed to deeply exploit the multi-modal interaction between RGB and Depth images on both coarse and fine scales. The main benefit of MTF is that it conducts the learning of intra-modality and inter-modality simultaneously and thus can achieve communication across different modalities more directly and sufficiently. Comprehensive experimental results on six public benchmarks demonstrate the superiority of our proposed MTFNet.

연구 동기 및 목표

  • 혼잡한 배경이나 열악한 이미지 품질 조건에서 RGB 및 깊이 이미지로부터 정확한 특징을 추출하는 데 도전한다.
  • RGB 및 깊이 모달 간의 보완적 정보를 활용하여 색채도 객체 검출 성능을 향상시킨다.
  • 내부 및 외부 모달 표현을 공동으로 학습하여 직접적이고 충분한 이종 모달 간 통신을 가능하게 한다.
  • RGB 및 깊이 데이터의 다중 척도 융합을 통해 특징 표현을 향상시키는 통합 프레임워크를 개발한다.

제안 방법

  • RGB 및 깊이 이미지 양쪽에 대해 CNN 기반 특징 추출을 안내하기 위해 픽셀 수준의 집중 정규화를 적용하는 집중형 특징 추출기(Focal Feature Extractor, FFE)를 도입한다.
  • 거시적 및 미세적 공간 척도에서 내부 모달 및 외부 모달 특징의 공동 학습을 수행하는 상호 트랜스포머 융합(Mutual-Transformer Fusion, MTF) 모듈을 설계한다.
  • MTF 모듈 내의 자기주의 주의 메커니즘을 통해 RGB 및 깊이 브랜치 간 이중 방향 특징 공유를 구현한다.
  • 특징 계층의 전역 및 국소 수준에서 표현 학습을 향상시키기 위해 다중 척도 특징 융합을 사용한다.
  • 정답 손실을 사용하여 엔드 투 엔드로 네트워크를 훈련시켜 색채도 예측 성능을 최적화한다.
  • MTF 내의 상호 주의 메커니즘을 활용하여 모달 특성 기반 및 이종 모달 의존성에 따라 특징을 동적으로 가중 및 융합한다.

실험 결과

연구 질문

  • RQ1혼잡한 배경이나 낮은 이미지 품질과 같은 도전적인 조건에서 RGB 및 깊이 이미지의 특징 추출 정확도를 어떻게 향상시킬 수 있는가?
  • RQ2내부 및 외부 모달 특징의 공동 학습이 RGB-D 색채도 객체 검출에서 특징 표현에 얼마나 기여하는가?
  • RQ3상호 트랜스포머 아키텍처는 다중 공간 척도에서 RGB 및 깊이 모달 간의 보완적 정보를 효과적으로 활용할 수 있는가?
  • RQ4제안된 MTFNet은 표준 RGB-D SOD 벤치마크에서 기존 최신 기술 수준의 방법들과 비교해 어떻게 성능을 내는가?

주요 결과

  • MTFNet은 여섯 개인 공개 RGB-D 색채도 객체 검출 벤치마크에서 최신 기술 수준의 성능을 달성한다.
  • 집중형 특징 추출기(FFE)는 CNN 기반 특징 학습에 픽셀 수준 정규화를 적용하여 특징 품질을 크게 향상시킨다.
  • 상호 트랜스포머 융합(MTF) 모듈은 이전 융합 방법보다 더 효과적이고 직접적인 이종 모달 간 통신을 가능하게 한다.
  • MTF에서 내부 및 외부 모달 특징의 공동 학습은 뛰어난 표현 학습과 검출 정확도를 이끌어낸다.
  • 다양한 데이터셋, 특히 다양한 이미지 품질과 배경 복잡도를 가진 환경에서도 모델이 강력한 일반화 성능을 보인다.
  • 포괄적인 추상화 연구를 통해 FFE 및 MTF 구성 요소가 성능 향상에 효과적임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.