Skip to main content
QUICK REVIEW

[논문 리뷰] Progressively Guided Alternate Refinement Network for RGB-D Salient Object Detection

Shuhan Chen, Yun Fu|arXiv (Cornell University)|2020. 08. 17.
Visual Attention and Saliency Detection참고 문헌 62인용 수 7
한 줄 요약

이 논문은 이미지넷 사전 훈련된 백본의 부적합성과 중복을 피하기 위해, 처음부터 훈련된 깊이 스트림을 사용하여 보완적인 고수준 깊이 특징을 추출하는 경량이고 효율적인 RGB-D 색재성 객체 탐지 네트워크를 제안한다. 교대로 개선 전략과 유도 잔차 블록을 활용하여 예측을 점진적으로 개선함으로써 상호 파손을 줄이고 정확도를 햖으며, 71 FPS 및 64.9 MB 모델 크기에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

In this paper, we aim to develop an efficient and compact deep network for RGB-D salient object detection, where the depth image provides complementary information to boost performance in complex scenarios. Starting from a coarse initial prediction by a multi-scale residual block, we propose a progressively guided alternate refinement network to refine it. Instead of using ImageNet pre-trained backbone network, we first construct a lightweight depth stream by learning from scratch, which can extract complementary features more efficiently with less redundancy. Then, different from the existing fusion based methods, RGB and depth features are fed into proposed guided residual (GR) blocks alternately to reduce their mutual degradation. By assigning progressive guidance in the stacked GR blocks within each side-output, the false detection and missing parts can be well remedied. Extensive experiments on seven benchmark datasets demonstrate that our model outperforms existing state-of-the-art approaches by a large margin, and also shows superiority in efficiency (71 FPS) and model size (64.9 MB).

연구 동기 및 목표

  • RGB-D 색재성 객체 탐지에서 이미지넷 사전 훈련된 백본을 사용한 깊이 특징 추출의 비효율성과 부적합성을 해결한다.
  • 사전 훈련된 네트워크에 의존하지 않고 처음부터 훈련된 경량 깊이 스트림을 통해 모델의 중복성과 계산 비용을 줄인다.
  • 특히 깊이 맵이 저품질이거나 노이즈가 많은 경우, RGB와 깊이 특징 간의 상호 파손을 완화한다.
  • 유도 잔차 블록을 통해 점진적으로 거친 예측을 개선하여 정확도를 향상시킨다.
  • 성능을 희생시키지 않고도 고효율성과 경량성을 확보하여 실시간 추론을 가능하게 한다.

제안 방법

  • 초기 훈련된 깊이 스트림을 구축하여 고수준 깊이 특징을 추출하며, 이는 저수준의 텍스처 중복을 피하기 위해 단지 네 개의 합성곱 레이어로 구성된다.
  • 다중 척도 잔차(MSR) 블록을 사용하여 RGB 특징에서 거친 예측을 초기 생성한다.
  • 교대로 개선 전략을 구현: RGB 및 깊이 특징을 순차적으로 유도 잔차(GR) 블록에 입력하여 확신 있는 RGB 특징의 열화를 방지한다.
  • 유도 잔차(GR) 블록을 설계하여 입력 예측 맵이 각 블록의 특징 맵과 예측 맵 둘 다의 개선을 유도한다.
  • 각 측면 출력 내에서 스택된 GR 블록 간에 점진적 유도를 적용하여 깊은 특징이 얕은 특징을 점진적으로 개선할 수 있도록 한다.
  • 다양한 해상도에서 측면 출력을 사용하여 개선 과정을 감독하고 국소화 정확도를 향상시킨다.

실험 결과

연구 질문

  • RQ1처음부터 훈련된 경량 깊이 스트림이 모델 크기와 계산 비용을 줄이며, 사전 훈련된 백본보다 RGB-D 색재성 객체 탐지에서 뛰어난 성능을 내는가?
  • RQ2RGB와 깊이 특징을 순차적으로 처리하는 교대로 개선 전략이 조기 또는 후기 융합과 비교해 상호 파손을 줄이는가?
  • RQ3스택된 GR 블록 내 점진적 유도가 색재성 객체 예측에서 누락된 부분과 잘못된 검출을 효과적으로 보완하는가?
  • RQ4저대비 이미지, 노이즈가 많은 깊이 맵, 복잡한 시나리오와 같은 도전적인 상황에서 제안된 방법의 성능은 어떠한가?
  • RQ5최신 기술 수준의 정확도를 달성하면서도 높은 추론 속도와 경량성을 유지하는 정도는 어느 정도인가?

주요 결과

  • 제안된 모델은 일곱 개의 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성하며, CPFP 및 DMRA와 같은 기존 방법들을 지속적으로 능가한다.
  • 모델은 64.9 MB의 매우 경량의 모델 크기로 71 FPS의 높은 속도로 작동하여 다른 최신 기술 수준의 모델들보다 추론 속도와 효율성에서 뚜렷한 우위를 점한다.
  • NJUD 및 NLPR 데이터셋에서, 사전 훈련된 백본을 피하는 것 외에도 DMRA 및 CPFP보다 높은 F-측도와 평균 F-스코어를 기록한다.
  • 시각적 비교 결과, 저대비 이미지, 노이즈가 많은 깊이 맵, 다수의 작은 객체가 포함된 복잡한 시나리오와 같은 어려운 케이스에서도 색재성 객체를 성공적으로 탐지함을 보여준다.
  • PR 곡선은 특히 높은 재현율 수준에서 뛰어난 성능을 보이며, 전체적인 색재성 객체 탐지 능력이 뛰어남을 시사한다.
  • 절단 실험 결과, 교대로 개선 전략과 점진적 유도가 정확도 향상과 저품질 깊이 입력에 대한 강건성 향상에 크게 기여하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.