Skip to main content
QUICK REVIEW

[논문 리뷰] Show, Match and Segment: Joint Weakly Supervised Learning of Semantic Matching and Object Co-segmentation

Yunchun Chen, Yen‐Yu Lin|arXiv (Cornell University)|2019. 06. 13.
Advanced Neural Network Applications참고 문헌 95인용 수 4
한 줄 요약

이 논문은 교차 작업 일致성 손실을 활용하여 의미 매칭과 객체 공세그멘테이션을 동시에 최적화하는 약한 지도 학습, 엔드 투 엔드 학습이 가능한 이중 스트림 네트워크를 제안한다. 예측된 마스크를 사용해 매칭 과정에서 배경 잡음을 억제하고, 고밀도 대응 관계를 통해 세그멘테이션에서 기하 일관성을 강제함으로써, 오직 이미지 수준의 지도 정보만을 사용하여 다섯 가지 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

We present an approach for jointly matching and segmenting object instances of the same category within a collection of images. In contrast to existing algorithms that tackle the tasks of semantic matching and object co-segmentation in isolation, our method exploits the complementary nature of the two tasks. The key insights of our method are two-fold. First, the estimated dense correspondence fields from semantic matching provide supervision for object co-segmentation by enforcing consistency between the predicted masks from a pair of images. Second, the predicted object masks from object co-segmentation in turn allow us to reduce the adverse effects due to background clutters for improving semantic matching. Our model is end-to-end trainable and does not require supervision from manually annotated correspondences and object masks. We validate the efficacy of our approach on five benchmark datasets: TSS, Internet, PF-PASCAL, PF-WILLOW, and SPair-71k, and show that our algorithm performs favorably against the state-of-the-art methods on both semantic matching and object co-segmentation tasks.

연구 동기 및 목표

  • 배경 잡음과 완전하지 않은 객체 커버리지 문제를 겪는 고립된 의미 매칭 및 객체 공세그멘테이션 방법의 한계를 해결하기 위해.
  • 의미 매칭과 객체 공세그멘테이션 간 상보적인 성질을 활용하여 양 작업의 성능 향상.
  • 비용이 많이 드는 수동 애너테이션 대신, 오직 약한 이미지 수준의 지도 정보(즉, 공통 객체가 있는 이미지 쌍)만을 요구하는 엔드 투 엔드 학습이 가능한 모델 개발.
  • 예측된 마스크와 이미지 쌍 간의 고밀도 대응 관계 간 기하학적 및 외관 일관성을 강제하는 교차 네트워크 일관성 손실 도입.
  • 공통 클래스 변형, 크기, 자세, 시점 차이에 대한 강건성을 향상시키기 위해 양자 최적화를 통한 성능 향상.

제안 방법

  • 이 방법은 이중 스트림 네트워크를 사용한다: 한 스트림은 의미 매칭을 위한 고밀도 대응 필드를 예측하고, 다른 스트림은 공세그멘테이션을 위한 전경 객체 마스크를 예측한다.
  • 예측된 마스크가 다른 스트림의 고밀도 대응 관계와 기하학적으로 일관성을 가지도록 하는 교차 네트워크 일관성 손실을 도입한다.
  • 의미 매칭을 위해 사이클 일관성 손실을 적용하여 예측된 이미지 변환의 기하학적 타당성을 향상시킨다.
  • 객체 공세그멘테이션을 위해, 인식 기반 대비 손실이 전경 외관 유사성을 강화하면서도, 커프오프 임계값 $m$을 사용해 도형-배경의 구분을 강제한다.
  • 예측된 열쇠점 대응 관계나 객체 마스크가 필요 없이 오직 이미지 수준의 지도 정보만을 사용하여 엔드 투 엔드로 학습한다.
  • 세그멘테이션 마스크를 정밀하게 다듬기 위해 DenseCRF, Otsu’s 또는 GrabCut을 후처리로 적용하며, 각 방법 간 성능 차이는 미미하다.

실험 결과

연구 질문

  • RQ1의미 매칭과 객체 공세그멘테이션의 공동 학습이 고립된 접근 방식에 비해 양 작업의 성능 향상에 기여하는가?
  • RQ2예측된 마스크와 고밀도 대응 관계로부터의 교차 작업 지도가 배경 잡음과 외관 변형에 대한 강건성을 어떻게 향상시키는가?
  • RQ3교차 네트워크 일관성 손실이 약한 지도 학습 환경에서 기하학적 및 외관 일관성을 얼마나 향상시키는가?
  • RQ4퍼셉트럴 대비 손실의 커프오프 임계값 $m$과 같은 하이퍼파rameter 설정에 대해 모델의 민감도는 어느 정도인가?
  • RQ5수동 애너테이션 없이도 약한 지도 학습, 엔드 투 엔드 학습이 가능한 프레임워크가 최신 기술 수준 성능을 달성할 수 있는가?

주요 결과

  • 제안된 방법은 의미 매칭과 객체 공세그멘테이션 양 측면에서 다섯 가지 벤치마크 데이터셋(TSS, Internet, PF-PASCAL, PF-WILLOW, SPair-71k)에서 최신 기술 수준 성능을 달성한다.
  • 커프오프 임계값 $m$을 2로 설정했을 때 인식 기반 대비 손실이 최적의 성능을 내며, 정밀도 $\mathcal{P}$와 재현율 지수 $\mathcal{J}$ 가 향상된다. $m$을 5 또는 10으로 증가시키면 성능이 저하된다.
  • 각각의 손실 성분(예: 사이클 일관성, 인식 기반 대비, 교차 네트워크 일관성)을 끄면 성능 저하가 심각하게 발생함을 확인하여 각 손실 항목의 기여도를 입증한다.
  • 손실 항목의 하이퍼파rameter를 너무 높게 설정하면(예: 1,000), 그 항목이 학습 목표에 지배적이 되어 성능 저하가 발생함을 보여주며, 하이퍼파rameter 조정에 민감함을 확인한다.
  • 모델은 GTX 1080 GPU에서 평균 21초에 한 장의 이미지를 처리하며, TSS 데이터셋의 800장에 대해 총 280분의 추론 시간이 소요된다.
  • DenseCRF, Otsu’s 또는 GrabCut을 후처리로 적용했을 때 성능에 유사한 영향을 미쳐, 모델의 세그멘테이션 출력이 다양한 정밀화 방법에 대해 강건하고 안정적임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.