Skip to main content
QUICK REVIEW

[논문 리뷰] CATrans: Context and Affinity Transformer for Few-Shot Segmentation

Shan Zhang, Tianyi Wu|arXiv (Cornell University)|2022. 04. 27.
Domain Adaptation and Few-Shot Learning인용 수 4
한 줄 요약

CATrans는 소수 샘플 이미지 세그멘테이션을 위한 새로운 컨텍스트 및 어파니티 트랜스포머를 제안하며, 관계 유도 컨텍스트(RCT) 및 관계 유도 어파니티(RAT) 모듈을 통합하여 이미지 간 특징 매칭을 향상시킨다. 지원 특징으로부터의 전역적 컨텍스트와 주의 기반 어파니티, 자가 어파니티 정규화를 활용함으로써 CATrans는 PASCAL-5i에서 최대 +2.8% mIoU, COCO-20i에서 +2.1% mIoU의 최신 기술 성능(SOTA)을 달성하며, ResNet-101 기반으로 구현된다.

ABSTRACT

Few-shot segmentation (FSS) aims to segment novel categories given scarce annotated support images. The crux of FSS is how to aggregate dense correlations between support and query images for query segmentation while being robust to the large variations in appearance and context. To this end, previous Transformer-based methods explore global consensus either on context similarity or affinity map between support-query pairs. In this work, we effectively integrate the context and affinity information via the proposed novel Context and Affinity Transformer (CATrans) in a hierarchical architecture. Specifically, the Relation-guided Context Transformer (RCT) propagates context information from support to query images conditioned on more informative support features. Based on the observation that a huge feature distinction between support and query pairs brings barriers for context knowledge transfer, the Relation-guided Affinity Transformer (RAT) measures attention-aware affinity as auxiliary information for FSS, in which the self-affinity is responsible for more reliable cross-affinity. We conduct experiments to demonstrate the effectiveness of the proposed model, outperforming the state-of-the-art methods.

연구 동기 및 목표

  • 소수 샘플 세그멘테이션(FSS)에서 큰 내부 클래스 외관 및 기하학적 변형 문제를 해결하기 위해 지원 이미지와 쿼리 이미지 간의 특징 매칭을 향상시키는 것.
  • 기존 트랜스포머 기반 FSS 방법이 컨텍스트나 어파니티에만 의존하는 한계를 극복하기 위해, 더 강건한 표현 학습을 위해 둘을 함께 모델링하는 것.
  • 구분력 있는 지원 특징을 활용하여 관계 유도 컨텍스트 트랜스포머(RCT)를 통해 지원 이미지에서 쿼리 이미지로 컨텍스트를 전달함으로써 컨텍스트 전달을 향상시키는 것.
  • 자기 어파니티를 보조 신호로 통합하여 피크셀 수준의 대응관계에서 노이즈를 감소시킴으로써 교차 어파니티 추정을 향상시키는 것.
  • 다중 해상도 컨텍스트와 어파니티 맵을 융합하는 계층적 아키텍처를 설계하여 세그멘테이션 정확도를 향상시키는 것.

제안 방법

  • 관계 유도 컨텍스트 트랜스포머(RCT)는 고수준의 지원 특징에 조건부된 트랜스포머 블록을 사용하여 지원 이미지에서 쿼리 이미지로 의미적 컨텍스트를 전파함으로써, 외관 변형 상황에서도 특징 정렬을 향상시킨다.
  • 관계 유도 어파니티 트랜스포머(RAT)는 지원 및 쿼리 특징 간의 주의 기반 교차 어파니티를 계산하며, 자가 어파니티 맵을 정규화 기법으로 사용하여 노이즈가 많은 상관관계를 억제한다.
  • CATrans는 계층적 아키텍처에서 RCT와 RAT를 통합하여 다중 수준의 상관관계 맵을 스택하여 특징 계층의 국소적 및 전역적 관계를 모두 포착한다.
  • 고해상도 쿼리 특징은 저해상도 상관관계 맵과 연결되어 디코더를 가이드함으로써 세그멘테이션의 공간 정밀도를 향상시킨다.
  • 이중 브랜치 특징 인코더(예: ResNet 또는 Swin-T)를 사용하고, RCT와 RAT에서 공유된 주의 메커니즘을 적용하여 파라미터 효율성을 유지한다.
  • 프레임워크는 교차 엔트로피 및 딱스 손실을 사용하여 엔드 투 엔드로 훈련되며, 소수 샘플 지원 마스크를 기반으로 쿼리 이미지의 피크셀 수준 세그멘테이션을 최적화한다.

실험 결과

연구 질문

  • RQ1큰 외관 변형 상황에서 소수 샘플 세그멘테이션 성능을 향상시키기 위해 트랜스포머 기반 아키텍처에서 컨텍스트와 어파니티 정보를 효과적으로 통합하는 방법은 무엇인가?
  • RQ2자기 어파니티 맵은 FSS의 지원-쿼리 매칭에서 교차 어파니티 추정의 신뢰성을 향상시킬 수 있는가?
  • RQ3다중 해상도 컨텍스트와 어파니티 표현의 계층적 융합은 단일 해상도 또는 비계층적 설계에 비해 더 나은 세그멘테이션 성능을 낳는가?
  • RQ4관계 유도 컨텍스트 전파를 통해 지원 특징 표현을 향상시키면 소수 샘플 설정에서 일반화 성능이 얼마나 향상되는가?
  • RQ5기존 주의 기반 매칭 메커니즘과 비교했을 때 제안된 RCT 및 RAT 모듈은 강건성과 정확도 측면에서 어떤가?

주요 결과

  • Swin-T를 백본으로 사용할 때 CATrans는 1-shot PASCAL-5i 벤치마크에서 67.6% mIoU를 달성하며, 이는 이전 SOTA인 DGPNet을 +2.8% 초월한 성능이다.
  • COCO-20i에서 CATrans는 5-shot 설정에서 Swin-T를 사용해 60.1% mIoU를 기록하며, DGPNet을 +2.0% 초월한다.
  • 제거 실험 결과, RCT와 RAT 모듈을 함께 사용할 경우 베이스라인 대비 +5% mIoU 향상이 있었으며, RCT 모듈만 사용해도 1-shot PASCAL-5i에서 최대 +7.7% 향상이 있었다.
  • 다중 해상도 특징 융합은 PASCAL-5i에서 1.4% 향상되고 COCO-20i에서는 1.8% 향상되어, 디코더에서 고해상도 가이던스의 유용성을 입증한다.
  • 모델은 다양한 백본 아키텍처에서 강력한 성능을 유지하며, ResNet-50 및 ResNet-101에서도 일관된 성능 향상을 보여 모델 용량에 대한 강건성을 입증한다.
  • 정성적 결과에서는 RAT가 형태 및 색상 유사성으로 인한 오분류를 줄이고, RCT가 큰 외관 변형 상황에서 컨텍스트 인식 세그멘테이션을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.