Skip to main content
QUICK REVIEW

[논문 리뷰] Boosting Few-shot Semantic Segmentation with Transformers

Guolei Sun, Yun Liu|arXiv (Cornell University)|2021. 08. 04.
Advanced Neural Network Applications참고 문헌 57인용 수 4
한 줄 요약

이 논문은 트랜스포머 기반의 전역적 맥락 모델링과 컨볼루션 기반의 국소적 특징 정련을 통합하는 새로운 소수 샘플 세분화 프레임워크인 TRFS를 제안한다. 트랜스포머 블록 기반의 전역 강화 모듈(GEM)과 컨볼루션을 사용하는 국소 강화 모듈(LEM)을 결합함으로써 TRFS는 PASCAL-5i 및 COCO 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하였으며, 소수 샘플 세분화에서 전역적 정보와 국소적 정보가 상호 보완적임을 입증한다.

ABSTRACT

Due to the fact that fully supervised semantic segmentation methods require sufficient fully-labeled data to work well and can not generalize to unseen classes, few-shot segmentation has attracted lots of research attention. Previous arts extract features from support and query images, which are processed jointly before making predictions on query images. The whole process is based on convolutional neural networks (CNN), leading to the problem that only local information is used. In this paper, we propose a TRansformer-based Few-shot Semantic segmentation method (TRFS). Specifically, our model consists of two modules: Global Enhancement Module (GEM) and Local Enhancement Module (LEM). GEM adopts transformer blocks to exploit global information, while LEM utilizes conventional convolutions to exploit local information, across query and support features. Both GEM and LEM are complementary, helping to learn better feature representations for segmenting query images. Extensive experiments on PASCAL-5i and COCO datasets show that our approach achieves new state-of-the-art performance, demonstrating its effectiveness.

연구 동기 및 목표

  • 기존의 소수 샘플 세분화 방법이 국소 수용장치에만 의존하여 장거리 맥락적 관계를 놓치는 한계를 해결한다.
  • 소수의 레이블이 부여된 지원 이미지만 존재하는 소수 샘플 세분화에서 트랜스포머를 통한 전역 맥락 모델링의 효과성을 탐구한다.
  • 전역(트랜스포머 기반) 및 국소(컨볼루션 기반) 특징 정련을 조합할 경우, 각각을 별도로 사용하는 것보다 우수한 성능을 달성함을 입증한다.
  • 표준 소수 샘플 세분화 벤치마크인 PASCAL-5i 및 COCO에서 최신 기술 수준의 성능을 달성한다.

제안 방법

  • 두 개의 브랜치 아키텍처를 제안: 트랜스포머 블록의 멀티헤드 자기주의를 활용해 쿼리 및 지원 특징 간의 장거리 의존성을 모델링하는 전역 강화 모듈(GEM).
  • 표준 컨볼루션 레이어를 적용하여 픽셀 수준에서 특징을 정련하는 국소 강화 모듈(LEM)을 도입한다. 이는 국소 공간적 세부 정보를 유지한다.
  • 쿼리 특징, 지원 프로토타입 특징, 사전 마스크를 하나의 특징 맵 $ H \times W \times (2C+1) $ 로 결합하며, 이 특징 맵은 GEM과 LEM이 병렬로 처리한다.
  • 다중 해상도에서의 특징 표현 강화를 위해 스케일 {60, 30, 15, 8} 에서 적응형 평균 풀링을 사용한다.
  • 쿼리 세분화 예측에 대한 교차 엔트로피 손실을 사용하여 엔드 투 엔드로 모델을 훈련하며, 정답 마스크로부터의 감독을 받는다.
  • 특징 추출을 위해 ResNet-50을 백본 네트워크로 사용하고, 이후 GEM 및 LEM를 통해 특징 결합 및 정련을 수행한다.

실험 결과

연구 질문

  • RQ1소수의 지원 이미지만 존재할 때 트랜스포머를 통한 전역 맥락 모델링이 소수 샘플 세분화 성능을 향상시킬 수 있는가?
  • RQ2소수 샘플 세분화에서 트랜스포머가 포착하는 전역 정보가 컨볼루션으로 추출된 국소 특징과 상호 보완적인가?
  • RQ3트랜스포머 레이어 수와 다중 해상도 처리 방식이 모델의 성능 및 새로운 클래스에 대한 일반화 능력에 미치는 영향은 무엇인가?
  • RQ4전역 및 국소 특징 정련을 조합할 경우, 각 모듈를 별도로 사용하는 것보다 더 높은 세분화 정확도를 달성하는가?

주요 결과

  • 제안된 TRFS 모델은 PASCAL-5i 데이터셋의 1-shot 설정에서 평균 mIoU 61.9를 달성하여 이전 최신 기술 수준(SOTA) 방법을 초월하였다.
  • 제거 실험 결과, GEM만 또는 LEM만 사용할 경우 평균 mIoU는 각각 60.6과 60.8로 유사한 성능를 보였지만, 두 모듈의 조합은 61.9를 기록하여 상호 보완적임을 입증하였다.
  • 3개의 트랜스포머 블록(L=3)을 사용한 모델가 최고의 성능를 기록하였으며, 이는 더 깊은 네트워크가 기본 클래스에 과적합되어 신규 클래스에서 성능이 떨어질 수 있음을 시사한다.
  • 다중 해상도 처리가 점진적으로 성능을 향상시켰다: 단일 해상도(58.6)에서 네 개의 해상도를 모두 사용한 경우(61.9)로 향상되었으며, 보고된 모든 결과에서 전체 스케일 세트 {60, 30, 15, 8} 가 사용되었다.
  • 정성적 결과는 TRFS가 단 한 장의 지원 이미지와 그 마스크만으로도 새로운, 미리 보지 않은 클래스에 대해 정확한 세분화 마스크를 생성함을 보여주었다.
  • COCO 데이터셋에서도 TRFS는 최신 기술 수준의 성능를 달성하여, PASCAL-5i 벤치마크를 초월한 일반화 능력을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.