Skip to main content
QUICK REVIEW

[논문 리뷰] Uncertainty Inspired RGB-D Saliency Detection

Jing Zhang, Deng-Ping Fan|arXiv (Cornell University)|2020. 09. 07.
Visual Attention and Saliency Detection참고 문헌 86인용 수 7
한 줄 요약

이 논문은 인간의 주석 불확실성을 잠재 변수를 가진 생성 모델로 모델링하는 최초의 확률적 프레임워크를 제안한다. 잠재 변수 추론에 조건부 변동 자동차오더(CVAE) 또는 번갈아가며 역전파(ABP)를 사용함으로써, 다양한 확률적 사전 예측을 생성하며, 여섯 개의 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

We propose the first stochastic framework to employ uncertainty for RGB-D saliency detection by learning from the data labeling process. Existing RGB-D saliency detection models treat this task as a point estimation problem by predicting a single saliency map following a deterministic learning pipeline. We argue that, however, the deterministic solution is relatively ill-posed. Inspired by the saliency data labeling process, we propose a generative architecture to achieve probabilistic RGB-D saliency detection which utilizes a latent variable to model the labeling variations. Our framework includes two main models: 1) a generator model, which maps the input image and latent variable to stochastic saliency prediction, and 2) an inference model, which gradually updates the latent variable by sampling it from the true or approximate posterior distribution. The generator model is an encoder-decoder saliency network. To infer the latent variable, we introduce two different solutions: i) a Conditional Variational Auto-encoder with an extra encoder to approximate the posterior distribution of the latent variable; and ii) an Alternating Back-Propagation technique, which directly samples the latent variable from the true posterior distribution. Qualitative and quantitative results on six challenging RGB-D benchmark datasets show our approach's superior performance in learning the distribution of saliency maps. The source code is publicly available via our project page: https://github.com/JingZhang617/UCNet.

연구 동기 및 목표

  • 기존의 RGB-D 사전 예측 방법에서 결정론적으로 취급되는 인간 주석의 본질적 주관성과 불확실성을 해결하기 위해.
  • 단일 결정론적 출력을 예측하는 것이 아니라, 인간 인지의 변동성을 반영하기 위해 사전 예측 지도의 분포를 모델링하기 위해.
  • 잠재 변수를 통해 레이블링 변동성을 학습함으로써 다양한 사전 예측을 생성하는 생성 프레임워크를 개발하기 위해.
  • 불확실성 모델링을 위한 두 가지 추론 전략—보조 인코더를 가진 CVAE와 기울기 기반 MCMC를 사용하는 ABP—의 상대적 이점과 상호 간의 상충 관계를 평가하기 위해.
  • 제안된 프레임워크를 표준 RGB 사전 예측 검출로 확장하여, 아키텍처 변경 없이도 일반화 능력과 최신 기술 수준의 성능을 입증하기 위해.

제안 방법

  • 입력 RGB-D 이미지와 잠재 변수를 기반으로 생성자 네트워크가 인코더-디코더 아키텍처를 사용하여 확률적 사전 예측을 생성하는 생성 프레임워크를 제안한다.
  • 잠재 변수의 사후 분포를 근사하기 위해 추가적인 추론 네트워크를 갖춘 조건부 변동 자동차오더(CVAE)를 적용한다.
  • 기울기 기반 마르코프 체인 몬테 카를로(MCMC)를 사용하여 진정한 사후 분포로부터 직접 잠재 변수를 샘플링하는 대안적 역투영(ABP) 기법을 도입한다.
  • 다양한 예측을 하나의 고정밀도 결정론적 출력으로 통합하기 위해 사전 예측 공감 모듈을 사용하며, 이는 인간의 공감 과정을 모방한다.
  • 입력 모odal을 단순히 변경함으로써 동일한 네트워크 아키텍처를 RGB-D 및 RGB 사전 예측 검출에 모두 적용함으로써 모델의 유연성을 입증한다.
  • 재구성 손실과 적대적 손실의 조합을 사용하여 엔드 투 엔드로 모델을 훈련함으로써 생성된 사전 예측 지도의 품질과 다양성을 향상시킨다.

실험 결과

연구 질문

  • RQ1인간의 사전 예측 주석의 불확실성을 모델링함으로써 결정론적 접근에 비해 더 견고하고 현실적인 사전 예측을 도출할 수 있는가?
  • RQ2잠재 변수가 레이블링 변동성을 나타내며, 딥 생성 모델이 사전 예측 지도의 분포를 효과적으로 포착할 수 있는가?
  • RQ3사전 예측 불확실성 모델링을 위한 CVAE 기반 추론 모델과 ABP 기반 추론 방법 간의 상대적 이점과 상충 관계는 무엇인가?
  • RQ4제안된 프레임워크는 아키텍처 변경 없이도 표준 RGB 사전 예측 검출로 일반화될 수 있는가?
  • RQ5모델이 생성한 다양한 사전 예측 지도가 인간 주석에 존재하는 진정한 불확실성을 어느 정도 반영하는가?

주요 결과

  • 제안된 방법인 Ours_CVAE와 Ours_ABP는 여섯 개의 도전적인 RGB-D 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, Ours_ABP는 대부분의 지표에서 기존의 최신 기술을 초월하였다.
  • DUTS-TO 데이터셋에서 Ours_ABP는 평균 F-측정값 0.957, 딱지 점수 0.949, E-측정값 0.917를 기록하여 이전의 최신 기술 방법을 뛰어넘었다.
  • 정성적 결과에서 복잡한 환경에 대해 다양한 사전 예측 지도를 생성함으로써, 인간 주석의 불확실성을 반영하고 있음을 보여주었다.
  • 사전 예측 공감 모듈은 다수의 확률적 예측을 효과적으로 하나의 결정론적 출력으로 통합하여, 지표 주석 과정의 품질에 도달하는 데 성공하였다.
  • RGB 전용 사전 예측 검출로 확장한 결과, 동일한 프레임워크는 아키텍처 변경 없이도 ECSSD, DUTS, HKU-IS 등 여러 벤치마크에서 최신 기술 수준의 성능을 달성하였다.
  • ABP 기반 추론 방법은 CVAE에 비해 略으로 더 높은 성능을 기록했지만, 각 전방전파에 다중 MCMC 단계가 필요하여 훈련 시간이 더 오래 걸렸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.