[논문 리뷰] Prototype as Query for Few Shot Semantic Segmentation
이 논문은 소수의 샘플로도 효과적으로 세분화할 수 있는 새로운 소수 샘플 세분화 프레임워크인 ProtoFormer을 제안한다. 이 방법은 지원(set) 이미지의 프로토타입을 트랜스포머 디코더 내 조건부 쿼리로 간주함으로써, 쿼리 이미지의 관련 의미 특징에 주의를 집중시킨다. 쿼리 특징을 키와 값으로 모델링함으로써, 프로토타입 기반 또는 픽셀 수준의 방법보다 공간적 세부 정보를 더 효과적으로 포착할 수 있으며, 단지 0.6M개의 학습 가능한 파라미터로 COCO-20i에서 최고 성능을 달성한다.
Few-shot Semantic Segmentation (FSS) was proposed to segment unseen classes in a query image, referring to only a few annotated examples named support images. One of the characteristics of FSS is spatial inconsistency between query and support targets, e.g., texture or appearance. This greatly challenges the generalization ability of methods for FSS, which requires to effectively exploit the dependency of the query image and the support examples. Most existing methods abstracted support features into prototype vectors and implemented the interaction with query features using cosine similarity or feature concatenation. However, this simple interaction may not capture spatial details in query features. To alleviate this limitation, a few methods utilized all pixel-wise support information via computing the pixel-wise correlations between paired query and support features implemented with the attention mechanism of Transformer. These approaches suffer from heavy computation on the dot-product attention between all pixels of support and query features. In this paper, we propose a simple yet effective framework built upon Transformer termed as ProtoFormer to fully capture spatial details in query features. It views the abstracted prototype of the target class in support features as Query and the query features as Key and Value embeddings, which are input to the Transformer decoder. In this way, the spatial details can be better captured and the semantic features of target class in the query image can be focused. The output of the Transformer-based module can be viewed as semantic-aware dynamic kernels to filter out the segmentation mask from the enriched query features. Extensive experiments on PASCAL-$5^{i}$ and COCO-$20^{i}$ show that our ProtoFormer significantly advances the state-of-the-art methods.
연구 동기 및 목표
- 소수 샘플 세분화에서 지원 이미지와 쿼리 이미지 간의 공간적 일관성 문제를 해결하기 위해.
- 간단한 프로토타입 매칭이나 전체 픽셀 수준의 어텐션을 초월해 쿼리와 지원 이미지 간의 특징 상호작용을 향상시키기 위해.
- 세분화에서 세밀한 공간적 세부 정보를 유지하면서 계산 비용을 줄이기 위해.
- 소수의 레이블이 있는 예시로도 잘 일반화되는 경량이면서 효과적인 방법을 개발하기 위해.
- 소수 샘플 세분화를 위한 트랜스포머 내에서 프로토타입을 조건부 쿼리로 사용할 잠재력을 탐색하기 위해.
제안 방법
- 이 방법은 지원 이미지에서 도출된 클래스별 프로토타입을 트랜스포머 디코더 내에서 학습 가능한 쿼리 임베딩으로 간주한다.
- 쿼리 이미지에서 유도된 특징을 트랜스포머 디코더 내에서 키와 값으로 사용한다.
- 트랜스포머 디코더의 출력은 풍부한 쿼리 특징에서 얻은 세분화 마스크를 개선하기 위한 의미 인식 동적 커널 역할을 한다.
- 프로세스 후 특징 개선을 거친 후, 프레임워크는 최종 세분화 마스크를 생성하기 위해 픽셀 디코더 모듈을 통합한다.
- 공통 백본(예: ResNet50)을 사용해 지원 및 쿼리 이미지 양쪽에서 특징을 추출한다.
- 모델는 교차 엔트로피 손실과 딱지 손실을 사용해 세분화 감독을 받는 엔드 투 엔드 트레이너블 아키텍처를 갖춘다.
실험 결과
연구 질문
- RQ1지원 프로토타입을 트랜스포머 디코더 내에서 쿼리로 간주함으로써, 지원 이미지와 쿼리 이미지 간의 특징 정렬이 향상되는가?
- RQ2이 쿼리 기반 어텐션 메커니즘이 기존의 프로토타입 매칭 및 전체 픽셀 수준의 어텐션보다 소수 샘플 세분화에서 더 우수한 성능을 내는가?
- RQ3제안된 방법이 기존 방법보다 훨씬 적은 파라미터로 최고 성능을 달성할 수 있는가?
- RQ4모델 성능이 트랜스포머 레이어 수나 특징 채널 수에 얼마나 민감한가?
- RQ5프로토타입을 쿼리로 사용하는 메커니즘이 COCO-20i와 같은 복잡하고 다양한 데이터셋에서 일반화 능력을 향상시키는가?
주요 결과
- ProtoFormer은 COCO-20i에서 새로운 최고 성능을 달성했으며, ResNet101 백본 기준 1-샷 및 5-샷 세분화에서 각각 DCAMA를 3.5%와 2.8% 높은 평균 mIoU로 초월했다.
- PASCAL-5i에서, 1-샷 및 5-샷 설정에서 각각 0.9%와 1.0% 높은 평균 mIoU를 기록했으며, 추가로 0.03M개의 파라미터만 더 사용했다.
- 단지 0.6M개의 학습 가능한 파라미터로도 최고 성능을 달성했으며, 이는 DCAMA보다 훨씬 적은 수치로 높은 파라미터 효율성을 보여주었다.
- 절단 분석 결과, 트랜스포머 디코더 레이어 수에 대해 모델이 뛰어난 내성성을 보였으며, 단 1개의 레이어로도 최적의 성능을 달성했다.
- PASCAL-5i의 도전적인 폴드에서 강력한 성능 유지를 유지했으며, COCO-20i로의 일반화 능력도 뛰어나 강력한 일반화 능력을 보여주었다.
- 정성적 결과 분석에서, ProtoFormer은 배경을 전경으로 잘못 분류하는 현상을 줄이고, 경계 정렬을 향상시켜 기존 기준 방법보다 우수한 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.