Skip to main content
QUICK REVIEW

[논문 리뷰] Cost Aggregation with 4D Convolutional Swin Transformer for Few-Shot Segmentation

Sunghwan Hong, Seokju Cho|arXiv (Cornell University)|2022. 07. 22.
Advanced Neural Network Applications인용 수 10
한 줄 요약

이 논문은 소수 샘플 분할에서 비용 집계를 위한 새로운 4차원 컨볼루션 스위니 트랜스포머인 볼륨 집합(Volumetric Aggregation with Transformers, VAT)을 제안한다. 작은 커널 컨볼루션을 스위니 트랜스포머 이전에 통합하여 국소적 맥락과 인덕티브 바이어스를 유지하고, 외관 인식형 디코딩을 갖춘 계층적 피라미드 구조를 적용함으로써, VAT는 모든 주요 소수 샘플 분할 벤치마크와 의미적 대응 작업에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

This paper presents a novel cost aggregation network, called Volumetric Aggregation with Transformers (VAT), for few-shot segmentation. The use of transformers can benefit correlation map aggregation through self-attention over a global receptive field. However, the tokenization of a correlation map for transformer processing can be detrimental, because the discontinuity at token boundaries reduces the local context available near the token edges and decreases inductive bias. To address this problem, we propose a 4D Convolutional Swin Transformer, where a high-dimensional Swin Transformer is preceded by a series of small-kernel convolutions that impart local context to all pixels and introduce convolutional inductive bias. We additionally boost aggregation performance by applying transformers within a pyramidal structure, where aggregation at a coarser level guides aggregation at a finer level. Noise in the transformer output is then filtered in the subsequent decoder with the help of the query's appearance embedding. With this model, a new state-of-the-art is set for all the standard benchmarks in few-shot segmentation. It is shown that VAT attains state-of-the-art performance for semantic correspondence as well, where cost aggregation also plays a central role.

연구 동기 및 목표

  • 패치 기반 토큰화로 인해 발생하는 국소적 맥락 상실과 인덕티브 바이어스 감소 문제로 인해 표준 비전 트랜스포머가 비용 집계에 한계를 보이는 점을 해결한다.
  • 스위니 트랜스포머 이전에 소형 커널 4D 컨볼루션을 통합하여 공간적 구조를 유지하고 국소적 특징 표현을 향상시킴으로써 비용 집계 성능을 향상시킨다.
  • 더러운 수준의 집계가 더 세밀한 수준의 처리를 이끄는 계층적 피라미드 아키텍처를 도입하여 특징 정제를 향상시킨다.
  • 쿼리의 외관 임베딩을 활용하여 더 정확한 분할 예측을 위한 더 나은 정밀도를 얻기 위해 쿼리별 임베딩을 활용하는 외관 인식형 디코더를 통해 트랜스포머 출력의 노이즈를 감소시킨다.
  • 소수 샘플 분할 외에도 의미적 대응 작업 등 다양한 매칭 작업으로의 일반화 잠재력을 입증하기 위해 제안된 비용 집계 방법이 최신 기술 수준(SOTA) 성능을 달성하도록 한다.

제안 방법

  • 4D 상관 매트릭스(배치, 채널, H, W)를 처리할 수 있도록 스위니 트랜스포머의 패치 임베딩 모듈을 확장한 4D 컨볼루션 스위니 트랜스포머를 제안하여 매칭 비용 볼륨에 대한 전역 자기주의를 가능하게 한다.
  • 패치 경계에서의 불연속성 문제를 완화하기 위해 트랜스포머 이전에 겹치는 소형 커널 4D 컨볼루션을 도입하여 국소적 맥락과 인덕티브 바이어스를 주입한다.
  • 더러운 해상도 수준에서 집계된 비용 매트릭스를 더 세밀한 해상도 수준의 추가 입력으로 연결하는 계층적 피라미드 아키텍처를 설계하여 다중 해상도 가이드라인을 제공한다.
  • 쿼리의 외관 임베딩을 활용하여 최종 집계된 비용 볼륨을 정제하는 유사도 인식형 디코더를 구현하여 공간적 세부 정보를 향상시키고 노이즈를 감소시킨다.
  • 백본 네트워크(예: ResNet)를 통해 특징 추출을 수행하고, 지원-쿼리 쌍에 대해 표준 분할 손실(예: 교차 엔트로피)을 사용하여 모델을 엔드 투 엔드로 훈련시킨다.
  • 자기주의 계산 중 공간 관계를 유지하기 위해 4D 공간 상관 매트릭스에 적응된 학습 가능한 위치 인코딩을 사용한다.

실험 결과

연구 질문

  • RQ14D 컨볼루션 스위니 트랜스포머는 소수 샘플 분할에서 비용 볼륨을 효과적으로 집계하면서 국소적 맥락과 인덕티브 바이어스를 유지할 수 있는가?
  • RQ2다양한 스케일에서의 계층적 집계는 소수 샘플 분할에서 비용 볼륨 정제의 정확성과 강건성을 향상시키는가?
  • RQ3제안된 비용 집계 메커니즘은 소수 샘플 분할 외에도 의미적 대응과 같은 다른 매칭 작업으로 일반화될 수 있는가?
  • RQ4디코더에 외관 임베딩을 통합함으로써 표준 트랜스포머 기반 집계 대비 분할 품질은 얼마나 향상되는가?
  • RQ5표준 4D 컨볼루션을 하이브리드 컨볼루션-트랜스포머 접근법으로 대체할 경우, 모호하거나 혼잡한 입력에서 노이즈 감소와 성능 향상 정도는 어느 정도인가?

주요 결과

  • VAT는 PASCAL-5i, COCO-20i, FSS-1000를 포함한 모든 표준 소수 샘플 분할 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성했으며, COCO-20i(5샷)에서 평균 mBA 54.9, PASCAL-5i(5샷)에서 54.8을 기록했다.
  • 의미적 대응 작업을 위한 SPair-71k 벤치마크에서 VAT는 평균 정확도 55.5를 달성하여 이전 SOTA 메서드인 CATs(49.9)와 PMNC(50.4)를 초월했다.
  • 제거 실험을 통해 4D 컨볼루션 스템이 경계 아티팩트를 감소시키고 특히 반복 무늬가 있는 영역에서 국소적 맥락을 향상시켜 성능 향상에 기여함을 확인했다.
  • 계층적 피라미드 구조는 특징 정제에 기여하며, 제거 실험 결과 비피라미드 버전 대비 mBA 1.5–2.0% 향상됨을 보였다.
  • 외관 인식형 디코더는 최종 비용 볼륨의 노이즈를 감소시켜 배경 혼잡성이 있는 도전적인 케이스에서 더 선명하고 정확한 분할 마스크를 생성했다.
  • 모델은 의미적 대응 작업으로도 잘 일반화되었으며, 효과적인 비용 집계가 소수 샘플 분할과 대응 작업 모두에서 핵심적이고 제약적인 요소임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.