Skip to main content
QUICK REVIEW

[논문 리뷰] Weakly Supervised Learning of Foreground-Background Segmentation using Masked RBMs

Nicolas Heess, Nicolas Le Roux|arXiv (Cornell University)|2011. 07. 19.
Generative Adversarial Networks and Image Synthesis참고 문헌 11인용 수 6
한 줄 요약

이 논문은 약한 사전 지도 학습만을 사용하여 혼잡한 이미지에서 전경-배경 분할을 학습하는 마스크된 RBM 기반 모델을 제안한다. 일반적인 자연 이미지로 배경 모델을 부트스트랩하고, 전경은 이상치로 탐지함으로써 배경과 독립적으로 전경의 형태와 외관을 함께 모델링한다. 이는 견고한 생성 및 향상된 인식 성능을 가능하게 하며, 특히 라벨이 제한된 데이터에서 유의미한 성능 향상을 이룬다.

ABSTRACT

We propose an extension of the Restricted Boltzmann Machine (RBM) that allows the joint shape and appearance of foreground objects in cluttered images to be modeled independently of the background. We present a learning scheme that learns this representation directly from cluttered images with only very weak supervision. The model generates plausible samples and performs foreground-background segmentation. We demonstrate that representing foreground objects independently of the background can be beneficial in recognition tasks.

연구 동기 및 목표

  • 자연 이미지의 배경 혼잡함과 독립적으로 전경 객체 표현을 학습하는 생성 모델을 개발하는 것.
  • 일반적인 자연 이미지만을 사용하여 배경 모델링을 위한 약한 사전 지도 학습을 통해 전경-배경 분할을 가능하게 하는 것.
  • 배경의 변동에 강인한 전경 표현을 학습하여 인식 성능을 향상시키는 것.
  • 형태와 외관을 함께 모델링함으로써 분할 및 생성 품질이 향상됨을 입증하는 것.

제안 방법

  • 마스크된 RBM을 확장하여 단일 전경 객체와 배경을 두 개의 잠재 이미지로 모델링하며, 전경은 이진 마스크가 1인 영역에서만 가시하도록 한다.
  • 배경 이미지를 모델링하기 위해 Beta RBM을 사용하여 픽셀 강도의 평균과 분산을 모두 포착한다.
  • 특수화된 RBM을 사용하여 전경을 연속적인 외관 이미지와 이진 형태 마스크로 함께 모델링한다.
  • 학습 이미지 전반에 걸쳐 배경 모델의 이상치를 식별함으로써 전경 모델을 학습하며, 수동 레이블링이 필요 없다.
  • 관측된 데이터가 주어졌을 때 마스크, 전경 외관, 배경 이미지의 근사 후행 확률 추정을 통해 추론을 수행한다.
  • 동일한 배경 모델을 다양한 전경 객체 카테고리 간에 재사용함으로써 전이 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1생성 모델이 약한 사전 지도 학습만을 사용하여 혼잡한 이미지에서 전경 객체를 분할할 수 있는가?
  • RQ2형태와 외관을 함께 모델링하는 것이 별개로 모델링하는 것보다 분할 및 생성 성능을 향상시키는가?
  • RQ3배경을 무시함으로써 제한된 학습 데이터에서 인식 성능 향상은 어느 정도 이루어지는가?
  • RQ4공유된 배경 모델을 사용하여 다양한 객체 카테고리와 배경 변동에 일반화 가능한가?

주요 결과

  • 5000장의 이미지로 구성된 테스트 세트에서 모델은 전경-배경 분할에서 96%의 픽셀 단위 정확도를 달성하였으며, CRF 기반 베이스라인(79%)을 크게 앞서는 성능을 보였다.
  • 클래스당 10개의 학습 패치만을 사용하는 저데이터 인식 작업에서 FG-BG 모델은 88%의 분류 정확도를 달성하였고, 표준 RBM의 경우 66%에 그쳐 데이터 부족에 대한 강인성을 향상시켰다.
  • 상대적으로 적은 수의 은닉 유닛을 사용함에도 불구하고, 성별, 머리 자세, 헤어 스타일의 다양성을 가진 다양한 현실적인 얼굴 샘플을 성공적으로 생성하였다.
  • 다른 배경에 붙인 얼굴에 대해 테스트한 결과, 모델은 80%의 확률로 동일한 얼굴에 해당하는 이미지를 정확히 복구하였고, 표준 Beta RBM의 경우 뿐만 아니라 23%에 그쳐 배경 간섭을 줄였다.
  • 추론된 마스크를 무작위로 재할당하면 분할 성능이著しく 악화되었으며, 이는 모델이 의미 있는, 데이터에 의존적인 형태 표현을 학습하고 있음을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.