Skip to main content
QUICK REVIEW

[논문 리뷰] Few-shot Semantic Segmentation with Support-induced Graph Convolutional Network

Jie Liu, Yanqi Bao|arXiv (Cornell University)|2023. 01. 09.
Advanced Neural Network Applications인용 수 5
한 줄 요약

이 논문은 소수 샘플 세분화(Few-shot Semantic Segmentation, FSS)를 위한 지원 유도 그래프 컨볼루션 네트워크(SiGCN)를 제안하며, 지원 이미지로부터 유도된 그래프 추론을 통해 쿼리 이미지의 문맥적 구조를 명시적으로 채굴함으로써 쿼리 특징 표현을 향상시킵니다. 지원 유도 그래프 추론(SiGR) 모듈과 인스턴스 연관(IA) 모듈을 통합함으로써 SiGCN는 PASCAL-5i 및 COCO-20i 벤치마크에서 최신 기술 성능(SOTA)을 달성하였으며, 특히 외관 변화가 큰 상황에서도 뛰어난 성능을 보입니다.

ABSTRACT

Few-shot semantic segmentation (FSS) aims to achieve novel objects segmentation with only a few annotated samples and has made great progress recently. Most of the existing FSS models focus on the feature matching between support and query to tackle FSS. However, the appearance variations between objects from the same category could be extremely large, leading to unreliable feature matching and query mask prediction. To this end, we propose a Support-induced Graph Convolutional Network (SiGCN) to explicitly excavate latent context structure in query images. Specifically, we propose a Support-induced Graph Reasoning (SiGR) module to capture salient query object parts at different semantic levels with a Support-induced GCN. Furthermore, an instance association (IA) module is designed to capture high-order instance context from both support and query instances. By integrating the proposed two modules, SiGCN can learn rich query context representation, and thus being more robust to appearance variations. Extensive experiments on PASCAL-5i and COCO-20i demonstrate that our SiGCN achieves state-of-the-art performance.

연구 동기 및 목표

  • 기존의 특징 매칭 기반 방법의 성능 저하를 초래하는 소수 샘플 세분화(FSS)에서 지원 이미지와 쿼리 이미지 간의 큰 외관 변화 문제를 해결한다.
  • 쿼리 객체의 주목적 부분 간의 문맥적 관계를 명시적으로 모델링하여 쿼리 마스크 예측의 강건성을 향상시킨다.
  • 단순히 특징 매칭에 의존하는 것 외에, 지원 프로토타입을 활용해 그래프 기반의 문맥 학습을 유도하는 새로운 메커니즘을 도입한다.
  • 지원 및 쿼리 인스턴스 양쪽에서 고차원의 인스턴스 수준 문맥을 캡처하여 새로운 카테고리로의 세분화 일반화 능력을 향상시킨다.
  • 지원 및 쿼리 샘플 간의 심한 외관 변동에도 불구하고 1-shot 및 5-shot 설정에서 최신 기술 성능(SOTA)을 달성한다.

제안 방법

  • 지원-쿼리 특징 매칭에서 유도된 활성화 맵을 기반으로 쿼리 그래프를 구성하는 지원 유도 그래프 추론(SiGR) 모듈을 제안하며, 이는 분류 가능한 객체 부분에 집중한다.
  • 지원 프로토타입을 가이드로 사용하여 반복적으로 쿼리 그래프를 업데이트함으로써 더 정확하고 문맥에 기반한 특징 집합을 가능하게 한다.
  • 지원 및 쿼리 인스턴스 간의 관계를 모델링함으로써 고차원의 문맥적 특징을 캡처하는 인스턴스 연관(IA) 모듈을 설계한다.
  • 그래프 컨볼루션 네트워크(GCNs)를 활용해 쿼리 그래프 내 노드 간에 특징을 전파하고 정제하며, 지원 프로토타입이 메시지 전달 과정에 영향을 미친다.
  • 그래프 구축을 위한 고신뢰도·분류 가능한 부분 선택을 위해 마스크 임계치 기법(t=0.7)을 적용함으로써 정위치 정확도를 향상시킨다.
  • SiGR 및 IA 모듈을 통합한 유일한 SiGCN 프레임워크를 구성하여 쿼리 문맥 표현 및 지원 유도 추론을 동시에 최적화한다.
Figure 1: Comparison between (a) previous typical few-shot segmentation (FSS) methods and (b) the proposed support-induced graph convolutional network (SiGCN). (a) Previous FSS methods focus on designing effective feature matching mechanism between support prototypes/features and query feature. Howe
Figure 1: Comparison between (a) previous typical few-shot segmentation (FSS) methods and (b) the proposed support-induced graph convolutional network (SiGCN). (a) Previous FSS methods focus on designing effective feature matching mechanism between support prototypes/features and query feature. Howe

실험 결과

연구 질문

  • RQ1소수 샘플 세분화에서 큰 외관 변화가 존재하는 상황에서도 쿼리 객체의 문맥을 명시적으로 모델링하면 세분화의 강건성이 향상되는가?
  • RQ2기존의 특징 매칭 방식에 비해 지원 유도 그래프 추론은 FSS에서 특징 표현을 어떻게 향상시키는가?
  • RQ3지원 및 쿼리 이미지 양쪽에서 고차원의 인스턴스 수준 문맥을 통합함으로써 세분화 성능에 어떤 영향을 미치는가?
  • RQ4지원 프로토타입 수(k), 인스턴스 크기(s), 마스크 임계치(t)와 같은 하이퍼파라미터가 모델 성능에 미치는 영향은 어떠한가?
  • RQ5제안된 SiGCN 프레임워크는 1-shot 및 5-shot 설정에서 PASCAL-5i 및 COCO-20i와 같은 다양한 벤치마크에 대해 효과적으로 일반화되는가?

주요 결과

  • SiGCN는 PASCAL-5i에서 1-shot mIoU 65.3, 5-shot mIoU 77.5를 기록하며 최신 기술 성능(SOTA)을 달성하였으며, 이는 이전 방법들을 능가한다.
  • SiGR 모듈이 성능 향상에 가장 기여하며, 추론 분석 결과 기반 모델 대비 상당한 mIoU 향상이 관찰된다.
  • IA 모듈는 필수적이며, 제거할 경우 성능 저하가 발생함으로써 보완적인 고차원 문맥을 캡처하는 역할을 한다는 점을 시사한다.
  • 5개의 지원 프로토타입(k=5)을 사용할 경우 최고의 성능를 기록하여 프로토타입의 다양성과 가이드 품질 사이의 최적 균형을 이룬다.
  • 백본으로 ResNet-101을 사용할 경우 1-shot에서 65.7 mIoU를 기록하며, VGG16 및 ResNet-50를 초월하는 뛰어난 성능을 보였다.
  • 추론 결과에 따르면 t=0.7이 분류 가능한 부분을 선택하는 데 최적의 마스크 임계치이며, s=10이 문맥 모델링에 가장 우수한 인스턴스 크기임을 확인하였다.
Figure 2: Overall architecture of our proposed network. Firstly, the feature embedding and matching network are introduced to generate support feature $x_{s}$ , query feature $x_{q}$ , middle-level activation map $A_{m}^{r}$ , and high-level activation map $A_{h}^{r}$ . Then, the support-induced gra
Figure 2: Overall architecture of our proposed network. Firstly, the feature embedding and matching network are introduced to generate support feature $x_{s}$ , query feature $x_{q}$ , middle-level activation map $A_{m}^{r}$ , and high-level activation map $A_{h}^{r}$ . Then, the support-induced gra

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.