[논문 리뷰] Weakly Supervised Salient Object Detection Using Image Labels
이 논문은 이미지 수준의 레이블과 비지도 학습으로 생성된 시각적 주목 객체 맵을 노이즈 있는 애너테이션으로 활용하여, 완전 컨volution 신경망을 훈련하는 약한 지도 학습 주목 객체 검출 방법을 제안한다. 조건부 랜덤 필드(CRF)를 이용한 공간 일관성 강화와 클래스 활성화 맵(CAM)에 의해 유도되는 다중 작업 ResNet을 번갈아가며 예측을 정교화함으로써, 수천 개의 픽셀 수준 애너테이션을 요구하는 강한 지도 학습 방법과 비교해도 유사한 성능을 달성한다. 이는 주요 벤치마크 전반에서 성과를 보였다.
Deep learning based salient object detection has recently achieved great success with its performance greatly outperforms any other unsupervised methods. However, annotating per-pixel saliency masks is a tedious and inefficient procedure. In this paper, we note that superior salient object detection can be obtained by iteratively mining and correcting the labeling ambiguity on saliency maps from traditional unsupervised methods. We propose to use the combination of a coarse salient object activation map from the classification network and saliency maps generated from unsupervised methods as pixel-level annotation, and develop a simple yet very effective algorithm to train fully convolutional networks for salient object detection supervised by these noisy annotations. Our algorithm is based on alternately exploiting a graphical model and training a fully convolutional network for model updating. The graphical model corrects the internal labeling ambiguity through spatial consistency and structure preserving while the fully convolutional network helps to correct the cross-image semantic ambiguity and simultaneously update the coarse activation map for next iteration. Experimental results demonstrate that our proposed method greatly outperforms all state-of-the-art unsupervised saliency detection methods and can be comparable to the current best strongly-supervised methods training with thousands of pixel-level saliency map annotations on all public benchmarks.
연구 동기 및 목표
- 딥 러닝 기반 주목 객체 검출에서 픽셀 수준의 주목 마스크를 위한 높은 애너테이션 비용 문제를 해결하기 위해.
- 약한 지도 학습을 활용하여 비지도 학습 방법이 생성한 노이즈 있는 시각적 주목 맵의 공간 일관성 부족과 의미 모호성을 보완함으로써 비지도 학습 주목 검출 성능을 향상시키기 위해.
- 밀도 있는 픽셀 수준 애너테이션을 요구하지 않고도 시각적 주목 맵을 향상시킬 수 있는 일반화된 반복 최적화 프레임워크를 개발하기 위해.
- 픽셀 수준 애너테이션 대신 이미지 수준의 레이블과 비지도 초기화만을 사용하여 강한 지도 학습 방법과 동등한 성능을 달성하기 위해.
제안 방법
- 이 방법은 조건부 랜덤 필드(CRF)를 사용하여 시각적 주목 맵의 공간 일관성과 구조 보존을 강제함으로써 내부 레이블링의 모호성을 보정한다.
- 다중 작업 완전 컨volution 신경망은 이미지 수준의 레이블과 비지도 학습 방법으로부터 반복적으로 보정된 픽셀 수준 애너테이션을 함께 사용하여 훈련된다.
- 신경망은 두 가지 출력을 생성한다: 주목 객체의 추정 위치를 위한 클래스 활성화 맵(CAM)과 정밀도 향상을 위한 보정된 시각적 주목 맵.
- 프레임워크는 CRF 기반 보정과 딥 네트워크 훈련을 번갈아 수행하며, CAM은 이미지 간 의미 모호성 보정을 유도한다.
- CRF의 단항 잠재변수는 딥 네트워크에서 유도된 보정된 시각적 주목 맵과 CAM을 반복적으로 업데이트하여 갱신된다.
- 모든 비지도 학습 방법의 결과 시각적 주목 맵으로 초기화되기 때문에, 이 프레임워크는 일반화 가능하며 다양한 기초 방법에 적용 가능하다.
실험 결과
연구 질문
- RQ1픽셀 수준 애너테이션 없이 이미지 수준의 레이블과 비지도 초기화만을 사용하여 주목 검출 성능을 크게 향상시킬 수 있는가?
- RQ2딥 네트워크가 비지도 학습 방법이 생성한 노이즈 있는 시각적 주목 맵의 레이블링 모호성을 얼마나 효과적으로 보정할 수 있는가?
- RQ3클래스 활성화 맵(CAM)을 통합할 경우, 약한 지도 학습 주목 검출의 정확도와 국소화 정확도는 어느 정도 향상되는가?
- RQ4CRF 기반 공간 정규화와 딥 네트워크 학습의 조합이 강한 지도 학습 방법과 비교해 유사한 성능을 달성할 수 있는가?
- RQ5제안된 최적화 프레임워크는 다양한 비지도 주목 검출 기초 방법에 대해 일반화 가능한가?
주요 결과
- 제안된 방법은 PASCAL-S 데이터셋에서 최대 F-측정값 0.913을 기록하여 모든 최신 비지도 학습 방법을 능가했다.
- HKU-IS 데이터셋에서 MAE는 0.041로 감소하여 가장 우수한 비지도 학습 방법보다 유의미한 격차를 확보했다.
- 픽셀 수준 애너테이션 없이 이미지 수준의 레이블만을 사용하여도, 수천 개의 픽셀 수준 애너테이션을 요구하는 강한 지도 학습 방법과 유사한 성능을 달성했다.
- MSRA-B 데이터셋의 진짜 마스크를 반영한 준강한 지도 학습 설정에서, HKU-IS, ECSSD, PASCAL-S에서 모든 강한 지도 학습 기반 벤치마크를 초월했다.
- 절단 분석 결과, CAM 가이던스가 성능 향상에 가장 기여했으며, 기존 비지도 학습 방법 대비 최대 F-측정값은 5.22% 향상되고 MAE는 16.6% 감소했다.
- 이 방법은 다양한 비지도 학습 기초 방법(BSCA, MST 등)을 포함해 여러 벤치마크에서 성능 향상이 뚜렷하게 나타나 일반화 능력이 뛰어나다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.