Skip to main content
QUICK REVIEW

[논문 리뷰] Self-Guided and Cross-Guided Learning for Few-Shot Segmentation

Bingfeng Zhang, Jimin Xiao|arXiv (Cornell University)|2021. 03. 30.
Domain Adaptation and Few-Shot Learning참고 문헌 39인용 수 10
한 줄 요약

이 논문은 소수 샘플 이미지 분할을 위한 새로운 프레임워크인 Self-Guided and Cross-Guided Learning (SCL)을 제안한다. 이 프레임워크는 마스크된 글로벌 평균 풀링(GAP)으로 인한 정보 손실 문제를 해결하기 위해, 주석이 달린 지원 이미지에서 주요 및 보조 지원 벡터를 추출하는 자기 지도 모듈을 도입한다. 또한 다중 샘플 분할을 위해 예측을 적응적으로 융합하는 다중 지원 이미지 품질 기반의 교차 지도 모듈을 추가하여, PASCAL-5i(1샷 시 61.8% mIoU, 5샷 시 62.9% mIoU) 및 COCO-20i(1샷 시 37.0% mIoU, 5샷 시 39.9% mIoU)에서 최신 기준 성능을 달성한다.

ABSTRACT

Few-shot segmentation has been attracting a lot of attention due to its effectiveness to segment unseen object classes with a few annotated samples. Most existing approaches use masked Global Average Pooling (GAP) to encode an annotated support image to a feature vector to facilitate query image segmentation. However, this pipeline unavoidably loses some discriminative information due to the average operation. In this paper, we propose a simple but effective self-guided learning approach, where the lost critical information is mined. Specifically, through making an initial prediction for the annotated support image, the covered and uncovered foreground regions are encoded to the primary and auxiliary support vectors using masked GAP, respectively. By aggregating both primary and auxiliary support vectors, better segmentation performances are obtained on query images. Enlightened by our self-guided module for 1-shot segmentation, we propose a cross-guided module for multiple shot segmentation, where the final mask is fused using predictions from multiple annotated samples with high-quality support vectors contributing more and vice versa. This module improves the final prediction in the inference stage without re-training. Extensive experiments show that our approach achieves new state-of-the-art performances on both PASCAL-5i and COCO-20i datasets.

연구 동기 및 목표

  • GAP의 마스크 처리로 인해 평균화되면서 손실되는 특징 정보 문제를 해결하기 위해, 지원 이미지의 초기 예측을 활용하여 손실된 정보를 복구한다.
  • 표준 GAP를 사용할 경우 1샷 분할 성능 저하 문제를 해결하기 위해, 자기 지도 메커니즘을 통해 잃어버린 전경 정보를 탐색한다.
  • 다양한 지원 이미지 예측의 적응적 융합을 통해 다중 샘플 분할 성능을 향상시키며, 품질이 높은 예측이 더 큰 기여를 하도록 한다.
  • 모델 재학습이나 아키텍처 변경 없이도 추론 시 성능을 향상시킬 수 있는 교차 지도 모듈을 설계한다.
  • 기본 모델에 관계없이 표준 소수 샘플 분할 벤치마크에서 최신 기준 성능을 달성하며, 다양한 백본 모델에 대해 일반화 능력을 입증한다.

제안 방법

  • 지원 이미지의 초기 예측을 수행하는 프로토타입을 사용한 후, 마스크된 GAP를 통해 주요(덮어진) 및 보조(노출된) 전경 특징 벡터를 추출하는 자기 지도 모듈(SGM)을 제안한다.
  • SGM을 훈련하기 위해 두 가지 크로스 엔트로피 손실을 사용한다: $\mathcal{L}_{ce}^{s1}$ 은 초기 예측을 감독하기 위한 것이고, $\mathcal{L}_{ce}^{s2}$ 는 지원 이미지를 쿼리로 간주하여 보조 벡터를 개선하기 위한 것이다.
  • 추론 시 주요 및 보조 지원 벡터를 모두 융합하여, 기존 GAP 기반 프로토타입을 초월한 쿼리 이미지 분할 성능을 향상시킨다.
  • 추론 중 다른 지원 이미지를 기준으로 하여 각 지원 이미지의 예측 품질을 평가하는 교차 지도 모듈(CGM)을 도입한다.
  • 재학습 없이도 예측의 품질에 따라 가중치를 적용하는 융합 전략을 적용하여, 품질이 높은 지원 이미지의 예측이 더 큰 기여를 하도록 한다.
  • SGM에서 생성된 병합된 지원 벡터를 쿼리 네트워크의 입력으로 사용하여, 향상된 분할 성능를 위한 더 풍부한 특징 융합을 가능하게 한다.

실험 결과

연구 질문

  • RQ1지원 이미지의 초기 예측을 활용하여 마스크된 GAP 과정에서 손실된 특징 정보를 복구할 수 있는가?
  • RQ2지원 이미지의 덮인 영역과 드러난 영역을 효과적으로 표현함으로써 분할 정확도를 향상시킬 수 있는가?
  • RQ3다중 샘플 분할에서 여러 지원 이미지 예측을 품질 기반으로 동적으로 융합하는 것이 단순 평균화보다 우수한가?
  • RQ4재학습 없이도 추론 후 처리 모듈을 통해 분할 성능을 향상시킬 수 있는가?
  • RQ5제안된 SGM 및 CGM이 표준 소수 샘플 분할 벤치마크에서 최신 기준 성능을 얼마나 향상시킬 수 있는가?

주요 결과

  • 제안된 자기 지도 모듈(SGM)은 단지 초기 지원 벡터만을 사용하여도 1샷 분할의 mIoU를 2.1% 향상시키고, FB-IoU를 4.1% 향상시킨다.
  • PASCAL-5i에서 전체 SCL 프레임워크는 5샷 분할 시 59.2% mIoU를 달성하여, 평균 융합 기반 베이스라인 대비 3.3% 향상되었다.
  • SGM와 함께 사용할 경우 교차 지도 모듈(CGM)은 평균 융합 대비 mIoU를 0.5% 향상시켜 추론 시 성능 향상의 효과를 입증한다.
  • SGM에서 $v_{pri}$ 와 $v_{aux}$ 벡터를 함께 사용할 경우 57.5% mIoU를 기록하여 개별 사용 또는 베이스라인 대비 뚜렷한 성능 향상을 보이며, 이들이 상호 보완적임을 입증한다.
  • 제거 실험 결과, $\mathcal{L}_{ce}^{s1}$ 과 $\mathcal{L}_{ce}^{s2}$ 가 모두 필수적임을 확인하였다. 둘 중 하나만 사용할 경우 mIoU가 1.9% 감소한다.
  • 이 방법은 재학습 없이도 PASCAL-5i(1샷 시 61.8% mIoU, 5샷 시 62.9% mIoU) 및 COCO-20i(1샷 시 37.0% mIoU, 5샷 시 39.9% mIoU)에서 새로운 최신 기준 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.