Skip to main content
QUICK REVIEW

[논문 리뷰] Cost Aggregation Is All You Need for Few-Shot Segmentation

Sunghwan Hong, Seokju Cho|arXiv (Cornell University)|2021. 12. 22.
Advanced Neural Network Applications인용 수 9
한 줄 요약

이 논문은 소수의 지원 샘플만을 사용하여 고차원 상관 맵을 효율적으로 처리할 수 있는 새로운 비용 집계 네트워크인 Volumetric Aggregation with Transformers (VAT)를 제안한다. VAT는 4D 컨볼루션과 4D Swin 트랜스포머를 결합하여 쿼리 및 지원 이미지 간의 높은 차원의 상관 맵을 처리한다. 피라미드형 인코더와 볼륨 임bedding, 볼륨 트랜스포머 모듈을 사용함으로써, VAT는 모든 표준 소수 샘플링 분할 벤치마크에서 최고 성능을 기록하고, 아키텍처 수정 없이도 의미적 대응 작업에서도 놀랍게 최고 성능을 달성한다.

ABSTRACT

We introduce a novel cost aggregation network, dubbed Volumetric Aggregation with Transformers (VAT), to tackle the few-shot segmentation task by using both convolutions and transformers to efficiently handle high dimensional correlation maps between query and support. In specific, we propose our encoder consisting of volume embedding module to not only transform the correlation maps into more tractable size but also inject some convolutional inductive bias and volumetric transformer module for the cost aggregation. Our encoder has a pyramidal structure to let the coarser level aggregation to guide the finer level and enforce to learn complementary matching scores. We then feed the output into our affinity-aware decoder along with the projected feature maps for guiding the segmentation process. Combining these components, we conduct experiments to demonstrate the effectiveness of the proposed method, and our method sets a new state-of-the-art for all the standard benchmarks in few-shot segmentation task. Furthermore, we find that the proposed method attains state-of-the-art performance even for the standard benchmarks in semantic correspondence task although not specifically designed for this task. We also provide an extensive ablation study to validate our architectural choices. The trained weights and codes are available at: https://seokju-cho.github.io/VAT/.

연구 동기 및 목표

  • 소수의 레이블 데이터로 인해 발생하는 의미적 분할 과제를 해결하기 위해, 몇 개의 지원 샘플만으로도 소수 샘플링 분할을 가능하게 하는 것.
  • 외관 및 기하학적 변형에 강건한 픽셀 단위의 대응을 중시함으로써, 소수 샘플링 분할을 의미적 대응 과제로 재정의하여 매칭 정확도를 향상시키는 것.
  • 기존 방법들이 원시 상관 맵이나 국소 컨볼루션에 의존하는 데서 비롯되는 한계를 극복하기 위해, 전역적이고 주목적 기반의 비용 집계 메커니즘을 도입하는 것.
  • 소수 학습에서 고차원 상관 맵에 대해 컨볼루션의 인덕티브 바이어스와 자기주의 기반 메커니즘을 통합함으로써 일반화 성능 향상 여부를 검증하는 것.
  • 소수 샘플링 분할 모델이 특별히 그 작업을 위해 설계되지 않았음에도 불구하고 의미적 대응 과제로 일반화할 수 있는지 탐색하는 것.

제안 방법

  • 4D 컨볼루션을 사용한 볼륨 임베딩 모듈을 포함한 피라미드형 인코더를 도입하여 상관 맵의 차원을 감소시키고, 컨볼루션의 인덕티브 바이어스를 통합한다.
  • 볼륨 트랜스포머 모듈은 변환된 상관 맵에서 4D Swin 트랜스포머를 적용하여 공간적 및 채널 차원을 넘어선 장거리 상호작용을 수행함으로써 전역적 비용 집계를 수행한다.
  • 인코더는 다중 스케일에서 특징을 처리하며, 더 굵은 수준의 집계된 점수들이 더 미세한 수준의 학습을 이끄는 방식으로 상호보완적인 매칭 점수 학습을 강화한다.
  • 유사도 인식 디코더는 프로젝션된 외관 특징 및 유사도 맵을 사용하여 집계된 비용 특징을 정밀화하여 분할 마스크 예측 성능을 향상시킨다.
  • 표준 소수 샘플링 분할 벤치마크에서 표준 학습-학습 파라다임과 지원-쿼리 감독을 사용하여 엔드 투 엔드로 모델을 훈련시킨다.
  • 소량의 아키텍처 수정을 통해 출력 해상도 조정 및 특징 프로젝션 조정을 통해 동일한 모델을 의미적 대응 벤치마크에서 평가할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1기존 방법들이 원시 상관 맵이나 4D 컨볼루션에 의존하는 것과 비교해 볼 때, 하이브리드 컨볼루션-트랜스포머 아키텍처를 활용한 비용 집계가 소수 샘플링 분할 성능을 크게 향상시킬 수 있는가?
  • RQ2소수 샘플링 분할 모델이 의미적 대응 과제로 일반화될 수 있는 정도는 어느 정도이며, 픽셀 단위의 대응을 찾는 공통된 과제에 기반해 볼 때 그 가능성이 어떠한가?
  • RQ34D 특징 공간에서 컨볼루션의 인덕티브 바이어스와 자기주의 기반 메커니즘을 통합함으로써, 내부 클래스 변형에 대한 일반화 및 강건성 향상에 기여하는가?
  • RQ4다양한 백본 아키텍처(CNN 대 비전 트랜스포머)가 소수 샘플링 분할 성능에 미치는 영향은 어떠하며, 이들 간에 성능 격차가 존재하는가?
  • RQ5기존 방법들인 HSNet이나 CATs와 비교해 볼 때, 제안된 비용 집계 메커니즘이 모호한 패턴과 배경 혼잡을 다루는 데 더 효과적인가?

주요 결과

  • VAT는 PASCAL-Part, COCO-Part, LVIS를 포함한 모든 표준 소수 샘플링 분할 벤치마크에서 최고 성능을 기록하며, 이전 방법들을 능가한다.
  • SPair-71k 벤치마크에서 VAT는 54.2 PCK를 기록하여 새로운 최고 기록을 수립했으며, 이는 CATs(49.9)와 PMNC(50.4)를 모두 앞서는 성과이다.
  • PF-PASCAL에서 VAT는 92.3 PCK를 기록하여 CHM(91.6)에 이어 두 번째로 높은 성능을 기록했으며, 다른 방법들에 비해 뚜렷한 격차를 보이며 강력한 일반화 능력을 입증했다.
  • PF-WILLOW에서 VAT는 81.0 PCK를 기록하여 CATs(79.2)와 PMNC(79.4)를 앞서며 기하학적 변형에 대한 강건성을 입증했다.
  • 아키텍처 수정 없이도 의미적 대응 과제에서 최고 성능을 달성함으로써, 비용 집계가 다양한 비전 과제 간에서 전이 가능한 핵심 구성 요소임을 시사한다.
  • 제거 실험 결과, 볼륨 임베딩과 볼륨 트랜스포머의 조합이 필수적임을 확인했으며, 선형 및 패스트포머 변형도 유사한 성능를 보이며, 아키텍처 유형보다 전역 주목적의 중요성이 더 높다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.