[논문 리뷰] Contrast-Oriented Deep Neural Networks for Salient Object Detection
이 논문은 밀도 높은 픽셀 단위의 사전 예측을 위한 다중 척도 완전 컨volution 신경망(MS-FCN)과 영역 대비 모델링을 위한 세그먼트 수준의 공간 풀링 스트림을 조합한 하이브리드 대trast 중심 딥 신경망을 제안한다. 주의 기반 융합 모듈은 양 스트림의 예측을 적응적으로 융합하며, 두드러진 윤곽 특징을 포함한 맞춤형 완전 연결 CRF는 공간 일관성과 경계 정확도를 향상시켜 여섯 개의 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성한다.
Deep convolutional neural networks have become a key element in the recent breakthrough of salient object detection. However, existing CNN-based methods are based on either patch-wise (region-wise) training and inference or fully convolutional networks. Methods in the former category are generally time-consuming due to severe storage and computational redundancies among overlapping patches. To overcome this deficiency, methods in the second category attempt to directly map a raw input image to a predicted dense saliency map in a single network forward pass. Though being very efficient, it is arduous for these methods to detect salient objects of different scales or salient regions with weak semantic information. In this paper, we develop hybrid contrast-oriented deep neural networks to overcome the aforementioned limitations. Each of our deep networks is composed of two complementary components, including a fully convolutional stream for dense prediction and a segment-level spatial pooling stream for sparse saliency inference. We further propose an attentional module that learns weight maps for fusing the two saliency predictions from these two streams. A tailored alternate scheme is designed to train these deep networks by fine-tuning pre-trained baseline models. Finally, a customized fully connected CRF model incorporating a salient contour feature embedding can be optionally applied as a post-processing step to improve spatial coherence and contour positioning in the fused result from these two streams. Extensive experiments on six benchmark datasets demonstrate that our proposed model can significantly outperform the state of the art in terms of all popular evaluation metrics.
연구 동기 및 목표
- 겹치는 영역의 재처리로 인한 높은 계산 및 저장 오버헤드로 인해 성능이 저하되는 패치 기반 CNN의 한계를 극복하기 위해.
- 영역적 맥락의 부족과 경계 정밀도가 떨어지는 문제로 인해 다중 척도 객체 및 약한 의미적 영역을 다루기 어려운 완전 컨볼루션 네트워크(FCNs)의 단점을 해결하기 위해.
- 보완적인 딥 러닝 스트림을 사용하여 픽셀 수준과 세그먼트 수준에서의 시각적 대비를 명시적으로 모델링함으로써 사전 예측 성능을 향상시키기 위해.
- 두드러진 윤곽 특징 임bedding을 포함한 맞춤형 완전 연결 CRF를 통해 공간 일관성과 윤곽 정확도를 향상시키기 위해.
- 이중 스트림과 후처리의 공동 최적화를 통해 엔드 투 엔드로 학습 가능한 프레임워크를 구현하여 다양한 벤치마크에서 최신 기술 수준의 성능을 달성하기 위해.
제안 방법
- 다중 척도 수용장역을 활용하여 다양한 공간 척도에서의 시각적 대비를 포착함으로써, 다중 척도 완전 컨볼루션 네트워크(MS-FCN)를 사용하여 밀도 높은 사전 예측 지apap을 생성한다.
- 다중 이미지 세그멘테이션 수준에서 생성된 슈퍼픽셀을 처리하여 인접 영역 간의 대비를 기반으로 희소한 사전 예측 지apap을 계산하는 세그먼트 수준의 공간 풀링 스트림을 사용한다.
- MS-FCN와 세그먼트 수준 스트림의 예측을 조합하기 위해 동적 가중치를 학습하는 주의 기반 융합 모듈을 도입하여 픽셀 수준과 영역 수준의 대비 정보를 적응적으로 통합한다.
- 완전 연결 CRF를 후처리 단계로 적용하며, 두드러진 윤곽 특징 임베딩을 통합하여 공간 일관성을 향상시키고 경계 정밀도를 개선한다.
- 사전 학습된 기준 모델을 기반으로 한 맞춤형 교차 미세조정 방식을 사용하여 이중 스트림 아키텍처의 효과적인 공동 최적화를 가능하게 한다.
- MS-FCN 스트림에서 다양한 크기의 객체에 대한 내성성을 향상시키기 위해 다중 척도 입력 공급(스케일링 요소 1, 0.75, 0.5)을 적용한다.
실험 결과
연구 질문
- RQ1밀도 높은 예측 스트림과 희소 예측 스트림을 조합한 하이브리드 딥 네트워크 아키텍처가 기존의 완전 컨볼루션 또는 패치 기반 방법을 뛰어넘어 주목할 만한 객체 탐지 성능을 향상시킬 수 있는가?
- RQ2다중 척도 특징 학습과 세그먼트 수준의 대비 모델링이 다양한 척도와 약한 의미적 콘텐츠를 가진 객체 탐지에 얼마나 효과적으로 기여하는가?
- RQ3주의 기반 융합 메커니즘이 픽셀 수준과 영역 수준의 사전 예측 통합에 얼마나 효과적인가?
- RQ4CRF 후처리 단계에 두드러진 윤곽 특징을 통합하면 경계 정확도와 공간 일관성이 얼마나 향상되는가?
- RQ5제안된 프레임워크가 표준 평가 지표 하에서 여러 벤치마크 데이터셋에서 일관된 최신 기술 수준의 성능을 달성할 수 있는가?
주요 결과
- MS-FCN 스트림에서 VGG-16 대신 ResNet-101을 사용할 경우, DUT-OMRON 데이터셋에서 최대 F-측정치가 3.62% 향상되고 MAE가 7.32% 감소한다.
- 다중 척도 입력(스케일링 요소 1, 0.75, 0.5)을 도입하면 DUT-OMRON에서 최대 F-측정치가 2.46% 향상되고 MAE가 6.58% 감소한다.
- 다중 수준 이미지 세그멘테이션(세 단계)을 적용할 경우 DUT-OMRON에서 최대 F-측정치가 0.88% 향상되고 MAE가 1.40% 감소한다.
- 윤곽 유도 CRF 후처리를 통합할 경우 표준 CRF 대비 VGG-16 기반 모델에서 최대 F-측정치가 1.50% 향상되고 MAE가 8.57% 감소한다.
- 다중 척도 입력과 윤곽 유도 CRF를 적용한 ResNet-101 기반 모델은 DUT-OMRON에서 최대 F-측정치 89.6%와 MAE 0.048을 기록하여 이전 최신 기술 수준의 방법을 능가한다.
- 여섯 개의 벤치마크 데이터셋에서 실시한 광범위한 실험을 통해 제안된 방법이 F-측정치, MAE, E-측정치를 포함한 모든 표준 평가 지표에서 기존 방법을 일관되게 능가함을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.