Skip to main content
QUICK REVIEW

[논문 리뷰] IncepFormer: Efficient Inception Transformer with Pyramid Pooling for Semantic Segmentation

Lihua Fu, Haoyue Tian|arXiv (Cornell University)|2022. 12. 06.
Advanced Neural Network Applications인용 수 5
한 줄 요약

IncepFormer는 전역적 맥락과 미세한 국소화를 동시에 포착하기 위해 인셉션 유사 다중 척도 자기주의 메커니즘과 피라미드 풀링을 통합한 새로운 효율적인 트랜스포머 기반 아키텍처를 제안한다. ADE20K에서 47.7% mIoU, Cityscapes에서 82.0%를 기록하며 기존 방법들을 능가하는 최신 기술 수준의 성능을 달성하면서도 파라미터 수는 절반 이하, FLOPs 수도 적게 사용한다.

ABSTRACT

Semantic segmentation usually benefits from global contexts, fine localisation information, multi-scale features, etc. To advance Transformer-based segmenters with these aspects, we present a simple yet powerful semantic segmentation architecture, termed as IncepFormer. IncepFormer has two critical contributions as following. First, it introduces a novel pyramid structured Transformer encoder which harvests global context and fine localisation features simultaneously. These features are concatenated and fed into a convolution layer for final per-pixel prediction. Second, IncepFormer integrates an Inception-like architecture with depth-wise convolutions, and a light-weight feed-forward module in each self-attention layer, efficiently obtaining rich local multi-scale object features. Extensive experiments on five benchmarks show that our IncepFormer is superior to state-of-the-art methods in both accuracy and speed, e.g., 1) our IncepFormer-S achieves 47.7% mIoU on ADE20K which outperforms the existing best method by 1% while only costs half parameters and fewer FLOPs. 2) Our IncepFormer-B finally achieves 82.0% mIoU on Cityscapes dataset with 39.6M parameters. Code is available:github.com/shendu0321/IncepFormer.

연구 동기 및 목표

  • 표준 트랜스포머의 정신 분할에 대한 한계, 특히 높은 계산 비용과 부족한 다중 척도 특징 모델링을 해결하기 위해.
  • 자기주의에 컨볼루션과 풀링의 인덕티브 바이어스를 통합하여 더 나은 국소 및 전역 맥락 학습을 위한 특징 표현을 향상시키기 위해.
  • 다양한 인코더 스테이지에서 온 특징을 효과적으로 융합하여 고해상도 예측을 가능하게 하는 경량이고 효율적인 디코더를 설계하기 위해.
  • 다양한 벤치마크에서 모델 정확도, 파라미터 수, 계산 효율성 간의 우수한 균형을 달성하기 위해.

제안 방법

  • 깊이 분할 컨볼루션과 다중 척도 커널 크기, 풀링을 조합하여 수용 영역의 유연성과 인덕티브 바이어스를 향상시키는 인셉션 멀티헤드 자기주의(Inception Multi-Head Self-Attention, Incep-MHSA)를 도입한다.
  • 표준 위치 임베딩 대신 배치 정규화를 사용하고 경량 피드포워드 네트워크(E-FFN)를 적용하여 계산 비용을 줄이고 2D 공간 모델링 성능을 향상시킨다.
  • 피라미드 구조를 가진 인코더를 활용하여 각 자기주의 레이어 내외에서 다중 척도 특징을 인셉션 유사 설계로 포괄적으로 캡처한다.
  • 다양한 인코더 스테이지에서 온 특징을 업샘플링 후 연결하는 경량 업샘플-컨카트 디코더를 도입하여 국소 및 전역 맥락의 효율적 융합을 가능하게 한다.
  • 위치 임베딩을 사용하지 않고, 컨볼루션과 정규화 레이어에서 유도되는 공간 인덕티브 바이어스에 의존하는 단순한 엔드 투 엔드 학습 프레임워크를 사용한다.
  • 다양한 배포 시나리오에 적합한 효율성과 성능의 상호 보완을 위해 세 가지 변형(T, S, B)으로 아키텍처를 스케일링한다.

실험 결과

연구 질문

  • RQ1컨볼루션과 풀링에서 유도된 인덕티브 바이어스를 갖춘 트랜스포머 기반 인코더가 정신 분할에서 더 나은 특징 표현을 달성할 수 있는가?
  • RQ2강인한 객체 국소화 및 맥락 모델링을 위해 트랜스포머 레이어 간 및 레이어 내부에서 다중 척도 특징 학습을 어떻게 향상시킬 수 있는가?
  • RQ3계산 비용 증가 없이도 다양한 스테이지에서 온 다중 척도 특징을 효과적으로 융합할 수 있는 경량 디코더를 설계할 수 있는가?
  • RQ4자기주의에 피라미드 풀링과 인셉션 스타일 모듈을 통합하면 표준 트랜스포머에 비해 더 나은 정확도-효율성 균형을 달성할 수 있는가?
  • RQ5제안된 아키텍처가 기존 방법보다 훨씬 적은 파라미터와 FLOPs로 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • IncepFormer-S는 ADE20K에서 47.7% mIoU를 기록하며 이전 최신 기술 수준을 1% 초과해 달성하면서도 파라미터 수는 절반 이하, FLOPs 수도 줄였다.
  • IncepFormer-B는 39.6M 파라미터로 Cityscapes에서 82.0% mIoU를 달성하여, 더 적은 파라미터와 FLOPs로 Pascal Context에서 HRNet-OCR(56.2%)를 능가했다.
  • IncepFormer-S는 Cityscapes에서 SegFormer-B2보다 0.6% mIoU 높은 성능을 보였고, 계산 비용은 88.5% 감소(83.2G vs. 717.1G FLOPs)했다.
  • 제안된 업샘플-컨카트 디코더는 SegFormer 스타일 디코더 대비 mIoU를 0.2% 향상시켜 스테이지 간 특징 융합의 효과를 입증했다.
  • ADE20K에서 IncepFormer는 정확도와 효율성 측면에서 Swin Transformer, SETR, SegFormer를 모두 능가하는 최고의 성능-파라미터 균형을 달성했다.
  • 정성적 결과 분석에서 IncepFormer는 특히 복잡한 도시 환경에서 SegFormer보다 더 선명하고 정확한 세분화 마스크를 생성하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.