Skip to main content
QUICK REVIEW

[논문 리뷰] Pyramid Fusion Transformer for Semantic Segmentation

Zipeng Qin, Jianbo Liu|arXiv (Cornell University)|2022. 01. 11.
Advanced Neural Network Applications인용 수 11
한 줄 요약

이 논문은 다중 해상도 특징 융합을 통해 성능을 햖스하는 per-mask 의미 분할을 위한 다중 해상도 트랜스포머 디코더인 피라미드 퓨전 트랜스포머(PFT)를 제안한다. 교차 해상도 상호 쿼리 어텐션을 통해 특징 융합을 향상시키며, 1/8, 1/16, 1/32 해상도 피라미드에서의 특징을 활용하고 학습 가능한 쿼리와 교차 어텐션을 사용함으로써, 멀티스케일 추론 하에서 Swin-L 백본을 사용할 경우 ADE20K에서 57.4 mIoU를 달성하여 최신 기술 수준을 확립한다.

ABSTRACT

The recently proposed MaskFormer gives a refreshed perspective on the task of semantic segmentation: it shifts from the popular pixel-level classification paradigm to a mask-level classification method. In essence, it generates paired probabilities and masks corresponding to category segments and combines them during inference for the segmentation maps. In our study, we find that per-mask classification decoder on top of a single-scale feature is not effective enough to extract reliable probability or mask. To mine for rich semantic information across the feature pyramid, we propose a transformer-based Pyramid Fusion Transformer (PFT) for per-mask approach semantic segmentation with multi-scale features. The proposed transformer decoder performs cross-attention between the learnable queries and each spatial feature from the feature pyramid in parallel and uses cross-scale inter-query attention to exchange complimentary information. We achieve competitive performance on three widely used semantic segmentation datasets. In particular, on ADE20K validation set, our result with Swin-B backbone surpasses that of MaskFormer's with a much larger Swin-L backbone in both single-scale and multi-scale inference, achieving 54.1 mIoU and 55.7 mIoU respectively. Using a Swin-L backbone, we achieve single-scale 56.1 mIoU and multi-scale 57.4 mIoU, obtaining state-of-the-art performance on the dataset. Extensive experiments on three widely used semantic segmentation datasets verify the effectiveness of our proposed method.

연구 동기 및 목표

  • 단일 해상도 특징을 사용할 경우 세분화된 또는 전역적인 맥락 정보가 부족해 성능이 떨어지는 per-mask 분류 모델(예: MaskFormer)의 한계를 해결한다.
  • 과도한 계산 비용 없이 다중 해상도 특징을 효과적으로 융합하여 분할 정확도를 향상시킨다.
  • 다른 해상도 수준 간의 의미 정보를 교환할 수 있도록 효율적인 교차 해상도 어텐션 메커니즘을 설계한다.
  • 기존 카테고리에 해당하지 않는 객체에 대한 잘못된 어텐션을 억제하기 위해 새로운 어텐션 가중치 손실을 사용하여 쿼리-픽셀 어텐션 메커니즘을 최적화한다.
  • 계산 효율성을 유지하면서도 표준 벤치마크에서 최신 기술 수준의 성능을 달성한다.

제안 방법

  • 1/8, 1/16, 1/32 입력 해상도에서의 특징 맵을 동시에 처리하는 다중 해상도 트랜스포머 디코더를 제안하며, 공유된 학습 가능한 객체 쿼리를 사용한다.
  • 다른 해상도의 쿼리 간 소통을 가능하게 하여, 직접적인 교차 해상도 토큰 연산 없이도 보완적인 의미 정보를 참조할 수 있도록 교차 해상도 상호 쿼리 어텐션을 도입한다.
  • 쿼리와 다중 해상도 특징 간의 학습 가능한 쿼리 기반 교차 어텐션 메커니즘을 사용하여 확률 및 마스크 예측 쌍을 생성한다.
  • 기존 카테고리에 해당하지 않는 쿼리에 대해 정규화를 적용하는 새로운 어텐션 가중치 손실을 도입하여, 관련 없는 이미지 영역에 대한 잘못된 어텐션을 감소시킨다.
  • 모델 용량과 정규화의 균형을 맞추기 위해 어텐션 가중치 손실을 학습의 첫 3/4 동안만 최적화한다.
  • 디코더에서의 각 해상도 예측을 평균하여 최종 분할 맵을 생성함으로써 정확도와 견고성을 향상시킨다.

실험 결과

연구 질문

  • RQ1과도한 계산 비용 없이 트랜스포머 기반 디코더가 다중 해상도 특징을 효과적으로 융합하여 per-mask 의미 분할을 수행할 수 있는가?
  • RQ2모든 토큰에 대해 자기 어텐션을 사용하거나 단순 연결을 사용하는 것과 비교해 교차 해상도 상호 쿼리 어텐션은 서로 다른 해상도 수준 간의 특징 소통에 어떻게 기여하는가?
  • RQ3학습 중에 존재하지 않는 카테고리에 대한 어텐션을 억제하는 어텐션 가중치 손실을 도입할 경우 어떤 영향을 미치는가?
  • RQ4학습의 어느 시점에서 어텐션 가중치 손실을 제거하면 모델의 일반화 능력과 성능이 향상되는가?
  • RQ5성능과 FLOPs를 균형 있게 유지하기 위해 per-mask 분할에서 최적의 다중 해상도 특징의 수와 해상도는 무엇인가?

주요 결과

  • Swin-B 백본을 사용할 경우 멀티스케일 추론 하에서 ADE20K에서 55.7 mIoU를 달성하며, 훨씬 더 큰 Swin-L 백본을 사용한 MaskFormer를 능가한다.
  • Swin-B 백본을 사용할 경우 멀티스케일 추론 하에서 ADE20K에서 57.4 mIoU를 달성하여 데이터셋에서 새로운 최신 기술 수준 성능을 확립한다.
  • 제거 분석 결과, 1/8, 1/16, 1/32 해상도 특징을 사용할 경우 성능-계산 비용 트레이드오���이 최고로 나타나며, 48.7 mIoU를 기록한다. 반면 1/4 해상도 특징을 추가해도 성능은 48.9 mIoU로 약간 향상되지만 FLOP 비용이 크게 증가한다.
  • 어텐션 가중치 손실을 120k 반복까지만 적용할 경우 최고의 성능(48.7 mIoU)과 가장 낮은 분산을 기록하여, 조기 정규화 제거가 모델 용량을 향상시킨다는 것을 시사한다.
  • 초기 쿼리에 대한 추가 감독을 제거하면 성능이 약간 떨어지며(48.7에서 48.5 mIoU로), 이는 초기 감독이 쿼리와 네트워크 다이내믹스를 보다 잘 정렬하는 데 기여한다는 것을 시사한다.
  • 시각화 결과, 어텐션 가중치 손실을 제거할 경우 어텐션 가중치와 카테고리 마스크 간의 상관관계가 감소함을 확인하였으며, 이는 제거 후 쿼리가 목표 카테고리 외 영역에 더 많은 어텐션을 기울임을 의미한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.