Skip to main content
QUICK REVIEW

[논문 리뷰] Few-Shot Segmentation with Global and Local Contrastive Learning

Weide Liu, Zhonghua Wu|arXiv (Cornell University)|2021. 08. 11.
Advanced X-ray and CT Imaging참고 문헌 34인용 수 14
한 줄 요약

이 논문은 Query Guided Network (QG-Net)을 제안하며, 전역 및 국소 대비 학습을 통해 지원 이미지와 별도로 질의 이미지의 사전 지식을 독립적으로 추출하는 few-shot 세그멘테이션 방법이다. 공동 전역-국소 대비 손실을 사용해 레이블이 없는 질의 이미지에서 사전 지식 추출기를 훈련시킴으로써, 지원 특징과의 교차 attention을 향상시키는 정보성 있는 사전 영역 맵을 생성한다. 추가적인 장치 없이도 PASCAL-5i 및 COCO 데이터셋에서 새로운 최고 성능을 달성한다.

ABSTRACT

In this work, we address the challenging task of few-shot segmentation. Previous few-shot segmentation methods mainly employ the information of support images as guidance for query image segmentation. Although some works propose to build cross-reference between support and query images, their extraction of query information still depends on the support images. We here propose to extract the information from the query itself independently to benefit the few-shot segmentation task. To this end, we first propose a prior extractor to learn the query information from the unlabeled images with our proposed global-local contrastive learning. Then, we extract a set of predetermined priors via this prior extractor. With the obtained priors, we generate the prior region maps for query images, which locate the objects, as guidance to perform cross interaction with support features. In such a way, the extraction of query information is detached from the support branch, overcoming the limitation by support, and could obtain more informative query clues to achieve better interaction. Without bells and whistles, the proposed approach achieves new state-of-the-art performance for the few-shot segmentation task on PASCAL-5$^{i}$ and COCO datasets.

연구 동기 및 목표

  • 기존 few-shot 세그멘테이션 방법이 지원 이미지 지시에만 의존하고 질의 이미지 내부의 고유한 특징을 활용하지 못하는 한계를 해결하기 위해.
  • 질의 특징 학습을 지원 브랜치 의존성에서 분리함으로써 few-shot 세그멘테이션 일반화 성능을 향상시키기 위해.
  • 레이블이 없는 질의 이미지에서 분류 가능한 객체 수준 표현을 학습하는 자기지도 학습 기반 사전 지식 추출기를 개발하기 위해.
  • 독립적으로 학습된 사전 영역 맵을 사용해 질의 및 지원 특징 간의 교차 attention을 향상시키기 위해.

제안 방법

  • 레이블이 없는 질의 이미지에서 전역 및 국소 대비 학습의 조합을 사용해 사전 지식 추출기를 훈련시켜 사전에 정의된 객체 사전 지식을 학습한다.
  • 전역 대비 손실은 동일한 이미지의 다양한 증강 버전 간의 특징 거리를 최소화하여 전역 표현을 학습한다.
  • 국소 대비 손실은 Slic를 통해 생성된 이미지 패치에 적용되어, 동일한 이미지 내 서로 다른 객체를 구분하도록 하며 국소 특징의 분별성을 향상시킨다.
  • 사전 지식 추출기는 지원 이미지와 무관하게 질의 이미지 내 잠재적인 객체 위치를 강조하는 사전 영역 맵을 생성한다.
  • 이러한 사전 영역 맵은 지원 특징과의 교차 attention을 안내하여 상호작용 품질을 향상시킨다.
  • 이 방법은 VGG16, ResNet50, ResNet101 백본을 사용하며, 평가에 321×321 및 473×473 이미지 크기를 적용한다.

실험 결과

연구 질문

  • RQ1자기지도 대비 학습이 지원 기반 방법보다 few-shot 세그멘테이션에서 더 정보성 있는 질의 사전 지식을 추출할 수 있는가?
  • RQ2질의 특징 학습을 지원 이미지에서 분리함으로써 세그멘테이션 성능과 일반화 능력이 향상되는가?
  • RQ3전역 및 국소 대비 학습 구성 요소가 사전 표현 품질에 개별적으로 및 함께 기여하는 방식은 어떠한가?
  • RQ4패치 생성 방법(예: Slic 대비 Felzenszwalb) 중에서 사전 학습에 가장 분별성 있는 국소 특징을 제공하는 것은 무엇인가?
  • RQ5사전 영역 맵이 가이드된 영역 맵에 비해 진짜 객체 영역과 얼마나 겹치는가?

주요 결과

  • 제안된 방법은 PASCAL-5i 데이터셋에서 모든 백본 및 이미지 크기 설정에서 이전 SOTA 방법을 능가하는 새로운 최고 성능을 달성한다.
  • MS COCO 데이터셋에서 QG-Net은 1-shot 및 5-shot 설정에서 각각 PFENet보다 mIoU가 5.9% 및 7.4% 높게 기록했으며, 입력 크기가 더 작은 473×473임에도 불구하고 성능을 확보했다.
  • Slic를 사용한 패치 생성이 Felzenszwalb 방법보다 더 높은 성능을 내며, 사전 지식 추출기 훈련에 1000 에포크가 최적의 결과를 낳는다.
  • 사전 영역 맵의 재현율(Recall_p,gt)이 가이드된 영역 맵의 재현율(Recall_g,gt)을 초월하여, 사전 맵이 더 많은 진짜 객체 영역을 포함하고 있음을 시사한다.
  • 절단 분석 결과, 전역 및 국소 대비 손실을 결합할 경우 최고의 성능가능성을 보이며, 이는 두 구성 요소가 분류 가능한 사전 지식 학습에 상호 보완적인 역할을 한다는 것을 입증한다.
  • 실패 사례 분석을 통해 외관이 유사한 객체(예: 사람과 테디베어)를 구분하는 데 어려움이 있으며, 작은 객체 탐지에 한계가 있음을 확인하여 미세한 구분 및 소규모 인식 과제에 도전 과제가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.