[논문 리뷰] Self-Calibrated Cross Attention Network for Few-Shot Segmentation
이 논문은 소수 샘플 이미지 세분화를 위한 자기 校정형 크로스 어텐션 네트워크(SCCAN)를 제안하며, 패치 기반 자기 어テン션과 크로스 어텐션을 통해 쿼리 특징과 정렬된 서포트 특징을 융합함으로써 배경 불일치와 전경-배경 엉키는 문제를 완화하는 새로운 자기 校정형 크로스 어텐션(SCCA) 모듈을 도입한다. 이 방법은 COCO-20i에서 5-shot 설정에서 이전 최고 성능(SOTA) 대비 mIoU를 5.6% 향상시켜 최고의 성능을 달성한다.
The key to the success of few-shot segmentation (FSS) lies in how to effectively utilize support samples. Most solutions compress support foreground (FG) features into prototypes, but lose some spatial details. Instead, others use cross attention to fuse query features with uncompressed support FG. Query FG could be fused with support FG, however, query background (BG) cannot find matched BG features in support FG, yet inevitably integrates dissimilar features. Besides, as both query FG and BG are combined with support FG, they get entangled, thereby leading to ineffective segmentation. To cope with these issues, we design a self-calibrated cross attention (SCCA) block. For efficient patch-based attention, query and support features are firstly split into patches. Then, we design a patch alignment module to align each query patch with its most similar support patch for better cross attention. Specifically, SCCA takes a query patch as Q, and groups the patches from the same query image and the aligned patches from the support image as K&V. In this way, the query BG features are fused with matched BG features (from query patches), and thus the aforementioned issues will be mitigated. Moreover, when calculating SCCA, we design a scaled-cosine mechanism to better utilize the support features for similarity calculation. Extensive experiments conducted on PASCAL-5^i and COCO-20^i demonstrate the superiority of our model, e.g., the mIoU score under 5-shot setting on COCO-20^i is 5.6%+ better than previous state-of-the-arts. The code is available at https://github.com/Sam1224/SCCAN.
연구 동기 및 목표
- 쿼리와 서포트 특징을 융합할 때 배경 불일치와 전경-배경 엉킴 문제로 인해 성능이 저하되는 기존 소수 샘플 세분화 방법의 한계를 해결하기 위해.
- 프로토타입 압축을 피하고 정렬된 서포트 특징을 사용한 크로스 어텐션을 통해 공간적 세부 정보를 유지하기 위해.
- 쿼리 특징 내에서의 자기 어텐션과 서포트 특징과의 크로스 어텐션을 동시에 활용하여 특징 융합을 향상시키기 위해.
- 가짜 마스크 집합 모듈과 스케일드 코사인 메커니즘을 통해 어텐션 스코어 계산을 개선함으로써 소수 샘플 세분화의 강건성과 정확도를 높이기 위해.
제안 방법
- SCCA 블록은 쿼리 및 서포트 특징을 패치로 분할하고, 각 쿼리 패치가 전경 픽셀을 포함하는 가장 유사한 서포트 패치와 매칭되도록 패치 정렬 모듈을 사용한다.
- SCCA는 쿼리 패치에 대해 자기 어텐션을 계산하고, 쿼리 패치와 정렬된 서포트 패치 간에 크로스 어텐션을 수행함으로써, 동일한 쿼리 이미지의 배경 특징이 매칭된 배경 특징과 융합되도록 한다.
- 쿼리와 서포트 특징 간의 유사도 계산을 향상시키기 위해 스케일드 코사인 메커니즘을 도입하여 크로스 어텐션에서 서포트 특징의 효과적인 활용을 장려한다.
- 가짜 마스크 집합(PMA) 모듈은 모든 쌍별 유사도 스코어를 집계하여 노이즈에 민감도가 낮은 강력한 쿼리 마스크를 생성함으로써, 최대 유사도만을 사용하는 기존 방법에 비해 노이즈에 더 강건한 성능을 달성한다.
- 전체 SCCAN 모델은 메모리 효율적인 Swin Transformer 백본과 SCCA 블록을 통합하여 계산 비용을 줄인 효율적인 패치 기반 어텐션을 가능하게 한다.
- 모델은 엔드 투 엔드로 학습되며, 학습-학습 파라다임을 사용하여, 최소한의 레이블이 있는 예시로 새로운 클래스에 적응할 수 있도록 한다.
실험 결과
연구 질문
- RQ1쿼리 배경 특징이 해당하는 서포트 특징이 없을 경우 소수 샘플 세분화에서 배경 불일치를 어떻게 줄일 수 있는가?
- RQ2자기 校정형 크로스 어텐션은 특징 융합 과정에서 전경-배경 엉킴을 어느 정도 완화할 수 있는가?
- RQ3패치 기반 정렬과 스케일드 코사인 어텐션은 소수 샘플 세분화에서 크로스 어텐션의 품질을 향상시키는가?
- RQ4제안된 가짜 마스크 집합 모듈은 노이즈가 있는 어텐션 스코어에 대해 기존 방법과 비교해 어떤가?
- RQ5정점 세분화 정확도를 극대화하기 위해 패치 크기와 SCCA 블록 수의 최적 설정은 무엇인가?
주요 결과
- 제안된 SCCAN 모델은 COCO-20i 데이터셋에서 5-shot 설정에서 이전 SOTA 대비 mIoU를 5.6% 향상시켜 67.0% mIoU를 달성한다.
- 1-shot 설정에서 PASCAL-5i에서 모델은 67.0% mIoU를 기록하였으며, 분석 결과 PMA, PA, SC 각 구성 요소가 성능 향상에 점진적으로 기여하는 것으로 나타났다.
- 패치 정렬 모듈은 기본 SCCA 대비 mIoU를 0.5% 향상시켜 局부 어텐션 계산에서의 오정렬 문제를 감소시켰다.
- 스케일드 코사인 메커니즘은 어텐션 스코어 맵에서 시각화된 바와 같이 관련 있는 서포트 특징에 더 집중하도록 하여 특징 활용도를 향상시켰다.
- SCCA에 가장 적합한 패치 크기는 8로, PASCAL-5i와 COCO-20i 양쪽에서 가장 높은 mIoU를 달성하였다. 또한 8개의 SCCA 블록이 mIoU와 FB-IoU 측면에서 최고의 성능을 보였다.
- 단일 쿼리-서포트 쌍에 대해 추론 시 480.9 GFLOPs의 높은 효율성을 유지하여 실용적인 타당성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.