Skip to main content
QUICK REVIEW

[논문 리뷰] Feature Selective Transformer for Semantic Image Segmentation

Fangjian Lin, Tianyi Wu|arXiv (Cornell University)|2022. 03. 26.
Advanced Image and Video Retrieval Techniques인용 수 6
한 줄 요약

이 논문은 의미적 이미지 세그멘테이션을 위한 새로운 프레임워크인 기능 선택형 트랜스포머(FeSeFormer)를 제안한다. 이는 스케일 간 기능 융합을 향상시키기 위해 두 가지 핵심 모듈을 통해 구현된다: 쿼리당 모든 스케일에서 유의미한 기능을 동적으로 선택하는 스케일 수준 기능 선택(SFS), 그리고 적응형이고 교차 스케일 주의를 통해 기능을 융합하는 풀스케일 기능 융합(FFF). FeSeFormer는 PASCAL Context에서 58.91% mIoU, Cityscapes에서 84.46% mIoU를 기록하며 네 가지 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Recently, it has attracted more and more attentions to fuse multi-scale features for semantic image segmentation. Various works were proposed to employ progressive local or global fusion, but the feature fusions are not rich enough for modeling multi-scale context features. In this work, we focus on fusing multi-scale features from Transformer-based backbones for semantic segmentation, and propose a Feature Selective Transformer (FeSeFormer), which aggregates features from all scales (or levels) for each query feature. Specifically, we first propose a Scale-level Feature Selection (SFS) module, which can choose an informative subset from the whole multi-scale feature set for each scale, where those features that are important for the current scale (or level) are selected and the redundant are discarded. Furthermore, we propose a Full-scale Feature Fusion (FFF) module, which can adaptively fuse features of all scales for queries. Based on the proposed SFS and FFF modules, we develop a Feature Selective Transformer (FeSeFormer), and evaluate our FeSeFormer on four challenging semantic segmentation benchmarks, including PASCAL Context, ADE20K, COCO-Stuff 10K, and Cityscapes, outperforming the state-of-the-art.

연구 동기 및 목표

  • 기존의 다중 스케일 기능 융합 방법이 고정되거나 局부적인 융합 패턴에 의존하여 관련 없는 기능을 포함할 수 있는 한계를 해결한다.
  • 각 쿼리 기능이 인접한 스케일이나 사전 설정된 부분 집합이 아닌, 모든 스케일에 걸쳐 정보가 풍부한 기능에 선택적으로 주의할 수 있도록 맥락 모델링을 향상시킨다.
  • 계산 비용을 크게 증가시키지 않으면서도 기능 표현을 향상시키는 유연하고 적응형 융합 메커니즘을 개발한다.
  • 개선된 다중 스케일 기능 통합을 통해 주요 의미적 세그멘테이션 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다.

제안 방법

  • 쿼리 스케일당 전체 다중 스케일 기능 세트에서 정보가 풍부한 기능의 부분집합을 학습 가능한 주의를 통해 선택하는 스케일 수준 기능 선택(SFS) 모듈을 제안한다. 이는 여분의 기능을 기각한다.
  • 각 쿼리가 학습 가능한 교차 스케일 주의 메커니즘을 통해 모든 스케일의 기능에 주의를 기울이고 융합할 수 있도록 하는 풀스케일 기능 융합(FFF) 모듈을 도입한다.
  • SFS와 FFF를 스위니 트랜스포머를 백본으로 사용하고 경량 FCN 헤드를 사용하는 트랜스포머 기반 인코더-디코더 프레임워크에 통합한다.
  • 특히 가장 세밀한 스케일에서 계산 및 메모리 오버헤드를 줄이기 위해 고해상도 기능 맵에 투영 메커니즘을 적용한다.
  • 선택된 기능의 희박성(스퍼스티)을 제어하기 위해 비율 손실을 최적화하여 네트워크가 의미 있는, 압축된 기능 부분집합을 학습하도록 유도한다.
  • 표준 데이터 증강 및 학습률 스케줄을 사용하여 입력 해상도 480×480를 사용해 아블레이션 및 평가를 위한 엔드 투 엔드 학습을 수행한다.

실험 결과

연구 질문

  • RQ1모든 다중 스케일 기능에서의 동적이고 전역적인 기능 선택이 점진적 또는 국소적 융합보다 의미적 세그멘테이션 성능 향상에 기여하는가?
  • RQ2모든 스케일에서 희박하고 정보가 풍부한 기능 부분집합을 선택할 경우 표현 품질과 계산 효율성에 어떤 영향을 미치는가?
  • RQ3각 스케일당 선택된 기능의 최적 비율은 얼마이며, 이는 세그멘테이션 정확도에 어떤 영향을 미치는가?
  • RQ4모든 스케일에 걸쳐 적응형 융합이 고정 또는 이방향 융합 메커니즘(FPT 또는 GFFNet)보다 우월한가?
  • RQ5제안된 방법은 다양한 시나리오 복잡도와 카테고리 분포를 가진 다양한 벤치마크에서 일반화 가능한가?

주요 결과

  • FeSeFormer는 PASCAL Context에서 58.91% mIoU를 기록하여 이전 SOTA보다 +2.54% mIoU 향상되었다.
  • ADE20K에서는 54.43% mIoU를 달성하여 이전 SOTA보다 +1.29% mIoU 향상되었다.
  • COCO-Stuff 10K에서는 49.80% mIoU를 기록하여 대규모 및 긴 꼬리 분포를 가진 데이터셋에서 강력한 일반화 능력을 입증했다.
  • Cityscapes에서는 84.46% mIoU를 기록하여 고해상도 도시 환경 이해에서 새로운 SOTA 기록을 수립했다.
  • 아블레이션 연구 결과, SFS와 FFF를 결합하면 베이스라인 대비 +1.6% mIoU 향상이 있었으며, SFS만으로도 추가로 +0.71% 향상되었다.
  • 최적의 기능 선택 비율은 ρ=0.6이며, α=0.4로 설정된 비율 손실이 최고의 성능를 보였다. 이는 전체 주의보다 선택적 융합이 더 효과적임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.