Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Object Co-Segmentation

Weihao Li, Omid Hosseini Jafari|arXiv (Cornell University)|2018. 04. 17.
Advanced Neural Network Applications참고 문헌 49인용 수 14
한 줄 요약

이 논문은 상호 상관관계를 활용하여 이미지 쌍 간의 공통 객체를 동시에 분할하는 시아모이스 인코더-디코더 CNN인 Deep Object Co-Segmentation (DOCS)을 제안한다. 다양한 데이터셋에서 최신 기준 성능을 달성하며, 미세조정 없이도 훈련 데이터에 포함되지 않은 객체 클래스로의 일반화 능력이 뛰어나다.

ABSTRACT

This work presents a deep object co-segmentation (DOCS) approach for segmenting common objects of the same class within a pair of images. This means that the method learns to ignore common, or uncommon, background stuff and focuses on objects. If multiple object classes are presented in the image pair, they are jointly extracted as foreground. To address this task, we propose a CNN-based Siamese encoder-decoder architecture. The encoder extracts high-level semantic features of the foreground objects, a mutual correlation layer detects the common objects, and finally, the decoder generates the output foreground masks for each image. To train our model, we compile a large object co-segmentation dataset consisting of image pairs from the PASCAL VOC dataset with common objects masks. We evaluate our approach on commonly used datasets for co-segmentation tasks and observe that our approach consistently outperforms competing methods, for both seen and unseen object classes.

연구 동기 및 목표

  • 여러 객체 클래스가 존재하고 배경이 크게 다를 때 이미지 쌍 간의 공통 객체를 공분할하는 문제를 해결하기 위해.
  • 수작업 특징이나 후처리 CRF 최적화에 의존하지 않는 엔드 투 엔드 훈련 가능한 딥 러닝 프레임워크를 개발하기 위해.
  • 훈련 데이터에 포함되지 않은 객체 클래스로의 일반화 능력을 평가하기 위해, 특히 복잡한 다중 클래스 시나리오에서의 일반화 능력을 평가하기 위해.
  • PASCAL VOC에서 유래한 대규모 고품질 객체 공분할 데이터셋을 구축하고 공개하기 위해.

제안 방법

  • 두 개의 동일한 인코더가 각 입력 이미지에서 깊이 있는 의미적 특징을 추출하는 시아모이스 인코더-디코더 아키텍처를 사용한다.
  • 병목층에서 두 이미지 간 국소적 특징 상관관계를 계산하는 상호 상관층이, 높은 의미적 유사성을 가지는 영역을 강조한다.
  • 디코더 브랜치는 복소화 레이어를 통해 원본 이미지 특징과 상관 특징을 융합하여 세부적인 전경 마스크를 재구성한다.
  • 쌍으로 제공된 이미지의 진짜 마스크에 대한 지도 학습 손실을 사용하여 모델을 엔드 투 엔드로 훈련한다.
  • PASCAL VOC에서 유래한 새로운 데이터셋을 구성하였으며, 공통 객체 클래스에 대해 공유 마스크가 있는 이미지 쌍으로 구성되어 있다.
  • 일부 PASCAL 클래스에서 훈련하고 iCoseg의 미학습 클래스인 체타우, 패러, 하이어 발루 등에서 테스트하여 일반화 능력을 평가한다.

실험 결과

연구 질문

  • RQ1수작업 특징이나 CRF 후처리에 의존하지 않고도 순수 CNN 기반 아키텍처가 객체 공분할에서 최신 기준 성능을 달성할 수 있는가?
  • RQ2훈련 중에 볼 수 없었던 객체 클래스로의 공분할 모델 일반화 능력은 어떻게 되는가? 특히 다중 객체 시나리오에서의 일반화 능력을 평가한다.
  • RQ3상호 상관층이 이미지 쌍 간의 특징 매칭 및 분할 정확도 향상에 기여하는 정도는 어떠한가?
  • RQ4제안된 방법은 내부 클래스 변동성이 크고 배경이 다양한 표준 벤치마크 데이터셋에서 기존 공분할 접근법을 초월하는가?

주요 결과

  • iCoseg 데이터셋에서 미학습 객체 클래스를 대상으로 DOCS는 평균 Jaccard 점수 84.2를 기록하여 비교된 네 가지 최신 기준 방법보다 뛰어난 성능을 보였다.
  • 미학습 클래스 'brownbear'에 대해 DOCS는 Jaccard 점수 91.5를 기록하였으며, 이는 다음으로 높은 성능을 낸 방법(92.0)보다도 높은 성능을 기록하였다.
  • 상호 상관층은 Pascal VOC에서 Jaccard 점수를 49.9에서 64.5로 14.6점 향상시켰고, MSRC에서는 72.0에서 82.9로 10.9점 향상시켰다.
  • PASCAL 객체 클래스 10개만으로 훈련해도 DOCS는 iCoseg의 미학습 클래스에서 평균 Jaccard 점수 83.9를 기록하여 강력한 소수 샘플 일반화 능력을 입증하였다.
  • MSRC 데이터셋에서 DOCS는 Jaccard 점수 82.9를 기록하여 이전 최고 성능 방법보다 10.9점 높은 성능을 보였다.
  • 정성적 결과에서는 DOCS가 척도, 자세, 시점, 배경의 큰 변화가 있는 상황에서도 공통 객체를 정확하게 분할하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.