Skip to main content
QUICK REVIEW

[논문 리뷰] Richer and Deeper Supervision Network for Salient Object Detection

Sen Jia, Neil D. B. Bruce|arXiv (Cornell University)|2019. 01. 08.
Visual Attention and Saliency Detection참고 문헌 43인용 수 17
한 줄 요약

이 논문은 다중 해상도 출력 간의 특징 융합을 향상시키기 위해 더 풍부한 전역 및 국소 표현을 사용하는 Richer and Deeper Supervision (RDS) 네트워크를 제안한다. 객체 검출 데이터셋(ImageNet-DET 및 PASCAL-VOC)에서 사전 훈련하여 거시적 전역 맥락을 통합함으로써, 다섯 가지 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, F-측정치는 최대 0.953에 이르고 MAE는 최소 0.028에 달한다.

ABSTRACT

Recent Salient Object Detection (SOD) systems are mostly based on Convolutional Neural Networks (CNNs). Specifically, Deeply Supervised Saliency (DSS) system has shown it is very useful to add short connections to the network and supervising on the side output. In this work, we propose a new SOD system which aims at designing a more efficient and effective way to pass back global information. Richer and Deeper Supervision (RDS) is applied to better combine features from each side output without demanding much extra computational space. Meanwhile, the backbone network used for SOD is normally pre-trained on the object classification dataset, ImageNet. But the pre-trained model has been trained on cropped images in order to only focus on distinguishing features within the region of the object. But the ignored background information is also significant in the task of SOD. We try to solve this problem by introducing the training data designed for object detection. A coarse global information is learned based on an entire image with its bounding box before training on the SOD dataset. The large-scale of object images can slightly improve the performance of SOD. Our experiment shows the proposed RDS network achieves the state-of-the-art results on five public SOD datasets.

연구 동기 및 목표

  • 기존의 깊이 있는 감독 네트워크에서 얕은 전역 특징 전파의 한계를 해결하기 위해.
  • 계산 비용을 크게 증가시키지 않으면서 다중 해상도 사이드 아웃풋 간의 특징 융합 효율성을 향상시키기 위해.
  • 대규모 객체 검출 데이터셋을 활용한 사전 훈련을 통해 명시적 객체 검출의 데이터 부족 문제를 완화하기 위해.
  • ImageNet 분류 데이터보다 더 정보가 풍부한 객체 검출 애너테이션에서 유도된 배경 인식 특징을 통합하여 성능을 향상시키기 위해.
  • 명시적 객체 검출 데이터에 대한 사전 훈련과 ImageNet 분류 데이터에 대한 사전 훈련이 명시적 객체 검출에 미치는 영향을 조사하기 위해.

제안 방법

  • 더 풍부하고 깊은 감독 경로를 사용하여 사이드 아웃풋 간의 특징 융합을 향상시키고 전역 및 국소 특징 통합을 개선하는 새로운 RDS 네트워크 아키텍처를 제안한다.
  • 두 단계 훈련 전략을 도입한다: 먼저 ImageNet-DET + PASCAL-VOC를 통합한 객체 검출 데이터셋에서 사전 훈련하여 거시적 위치 맥락을 학습하고, 그 다음 SOD 데이터셋에서 사전 훈련한다.
  • 잔차 네트워크(ResNet-152)를 백본으로 사용하며, 여러 층에서 사이드 아웃풋을 제공하여 깊은 감독과 다중 수준의 특징 집합을 가능하게 한다.
  • 객체 검출 데이터셋의 바운딩 박스 애너테이션을 활용하여 사전 훈련 중 맥락 및 배경 인식 특징을 통합함으로써 일반화 능력을 향상시킨다.
  • 사이드 아웃풋에 대해 교차 엔트로피 손실과 L1 손실을 적용하여 고수준 의미 정보와 저수준 에지 세부 정보를 모두 유지하는 데 중점을 둔다.
  • 카오티스트릭 포그로팅을 완화하기 위해 두 단계의 피니어 투닝 프로세스를 사용하며, SOD 피니어 투닝 이전에 낮은 초기 학습률(0.001)을 사용한다.

실험 결과

연구 질문

  • RQ1더 풍부하고 깊은 감독 메커니즘은 계산 비용을 증가시키지 않으면서도 특징 융합을 향상시킬 수 있는가?
  • RQ2전체 이미지 맥락을 갖춘 객체 검출 데이터셋에서의 사전 훈련은 ImageNet 분류 사전 훈련보다 명시적 객체 검출 성능을 향상시키는가?
  • RQ3바운딩 박스 애너테이션에서 유도된 배경 및 객체 맥락의 포함 여부가 명시적 객체 검출에 어떤 영향을 미치는가?
  • RQ4다단계 사전 훈련을 사용할 경우, 객체 검출에서 명시적 객체 검출로 지식을 전이할 때 카오티스트릭 포그로팅이 어느 정도 영향을 미치는가?
  • RQ5제안된 RDS 네트워크는 다양한 공개 SOD 벤치마크에서 기존 최신 기술 수준의 방법들을 초월할 수 있는가?

주요 결과

  • RDS-152 모델은 HKU-IS 데이터셋에서 최고의 F-측정치 0.953을 기록하여 모든 다른 최신 기술 수준의 방법들을 능가했다.
  • DUT-OMRON 데이터셋에서 RDS-152는 최고의 F-측정치 0.837과 최저의 MAE 0.050을 기록하여 비교된 모든 방법들 중 1위를 차지했다.
  • RDS-152-OBJ 버전은 객체 검출 데이터에서 사전 훈련된 결과, PASCAL-SOD 서브셋에서 F-측정치 0.818을 기록하여 AMU 및 SRM과 같은 다른 방법들을 뛰어넘었다.
  • PR-곡선 분석을 통해 RDS-152-OBJ는 다섯 가지 공개 SOD 데이터셋 전반에서 경쟁자들을 일관되게 능가했으며, 특히 고재현 영역에서 두드러진 성능을 보였다.
  • 제거 분석 결과, 객체 검출 데이터에서의 사전 훈련이 경계 정확도 및 전역 맥락 이해도 향상에 특히 유의미한 성능 향상을 가져왔으며, 약간이지만 일관된 성능 향상을 보였다.
  • 객체 검출 사전 훈련으로 인한 약간의 성능 향상에도 불구하고, 모델는 여전히 카오티스트릭 포그로팅 문제를 겪었으며, 향후 연구에서는 더 나은 지속적 학습 전략이 필요하다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.