[논문 리뷰] IncepFormer: Efficient Inception Transformer with Pyramid Pooling for Semantic Segmentation
IncepFormer는 전역적 맥락과 미세한 국소화를 동시에 포착하기 위해 인셉션 유사 다중 척도 자기주의 메커니즘과 피라미드 풀링을 통합한 새로운 효율적인 트랜스포머 기반 아키텍처를 제안한다. ADE20K에서 47.7% mIoU, Cityscapes에서 82.0%를 기록하며 기존 방법들을 능가하는 최신 기술 수준의 성능을 달성하면서도 파라미터 수는 절반 이하, FLOPs 수도 적게 사용한다.
Semantic segmentation usually benefits from global contexts, fine localisation information, multi-scale features, etc. To advance Transformer-based segmenters with these aspects, we present a simple yet powerful semantic segmentation architecture, termed as IncepFormer. IncepFormer has two critical contributions as following. First, it introduces a novel pyramid structured Transformer encoder which harvests global context and fine localisation features simultaneously. These features are concatenated and fed into a convolution layer for final per-pixel prediction. Second, IncepFormer integrates an Inception-like architecture with depth-wise convolutions, and a light-weight feed-forward module in each self-attention layer, efficiently obtaining rich local multi-scale object features. Extensive experiments on five benchmarks show that our IncepFormer is superior to state-of-the-art methods in both accuracy and speed, e.g., 1) our IncepFormer-S achieves 47.7% mIoU on ADE20K which outperforms the existing best method by 1% while only costs half parameters and fewer FLOPs. 2) Our IncepFormer-B finally achieves 82.0% mIoU on Cityscapes dataset with 39.6M parameters. Code is available:github.com/shendu0321/IncepFormer.
연구 동기 및 목표
- 표준 트랜스포머의 정신 분할에 대한 한계, 특히 높은 계산 비용과 부족한 다중 척도 특징 모델링을 해결하기 위해.
- 자기주의에 컨볼루션과 풀링의 인덕티브 바이어스를 통합하여 더 나은 국소 및 전역 맥락 학습을 위한 특징 표현을 향상시키기 위해.
- 다양한 인코더 스테이지에서 온 특징을 효과적으로 융합하여 고해상도 예측을 가능하게 하는 경량이고 효율적인 디코더를 설계하기 위해.
- 다양한 벤치마크에서 모델 정확도, 파라미터 수, 계산 효율성 간의 우수한 균형을 달성하기 위해.
제안 방법
- 깊이 분할 컨볼루션과 다중 척도 커널 크기, 풀링을 조합하여 수용 영역의 유연성과 인덕티브 바이어스를 향상시키는 인셉션 멀티헤드 자기주의(Inception Multi-Head Self-Attention, Incep-MHSA)를 도입한다.
- 표준 위치 임베딩 대신 배치 정규화를 사용하고 경량 피드포워드 네트워크(E-FFN)를 적용하여 계산 비용을 줄이고 2D 공간 모델링 성능을 향상시킨다.
- 피라미드 구조를 가진 인코더를 활용하여 각 자기주의 레이어 내외에서 다중 척도 특징을 인셉션 유사 설계로 포괄적으로 캡처한다.
- 다양한 인코더 스테이지에서 온 특징을 업샘플링 후 연결하는 경량 업샘플-컨카트 디코더를 도입하여 국소 및 전역 맥락의 효율적 융합을 가능하게 한다.
- 위치 임베딩을 사용하지 않고, 컨볼루션과 정규화 레이어에서 유도되는 공간 인덕티브 바이어스에 의존하는 단순한 엔드 투 엔드 학습 프레임워크를 사용한다.
- 다양한 배포 시나리오에 적합한 효율성과 성능의 상호 보완을 위해 세 가지 변형(T, S, B)으로 아키텍처를 스케일링한다.
실험 결과
연구 질문
- RQ1컨볼루션과 풀링에서 유도된 인덕티브 바이어스를 갖춘 트랜스포머 기반 인코더가 정신 분할에서 더 나은 특징 표현을 달성할 수 있는가?
- RQ2강인한 객체 국소화 및 맥락 모델링을 위해 트랜스포머 레이어 간 및 레이어 내부에서 다중 척도 특징 학습을 어떻게 향상시킬 수 있는가?
- RQ3계산 비용 증가 없이도 다양한 스테이지에서 온 다중 척도 특징을 효과적으로 융합할 수 있는 경량 디코더를 설계할 수 있는가?
- RQ4자기주의에 피라미드 풀링과 인셉션 스타일 모듈을 통합하면 표준 트랜스포머에 비해 더 나은 정확도-효율성 균형을 달성할 수 있는가?
- RQ5제안된 아키텍처가 기존 방법보다 훨씬 적은 파라미터와 FLOPs로 최신 기술 수준의 성능을 달성할 수 있는가?
주요 결과
- IncepFormer-S는 ADE20K에서 47.7% mIoU를 기록하며 이전 최신 기술 수준을 1% 초과해 달성하면서도 파라미터 수는 절반 이하, FLOPs 수도 줄였다.
- IncepFormer-B는 39.6M 파라미터로 Cityscapes에서 82.0% mIoU를 달성하여, 더 적은 파라미터와 FLOPs로 Pascal Context에서 HRNet-OCR(56.2%)를 능가했다.
- IncepFormer-S는 Cityscapes에서 SegFormer-B2보다 0.6% mIoU 높은 성능을 보였고, 계산 비용은 88.5% 감소(83.2G vs. 717.1G FLOPs)했다.
- 제안된 업샘플-컨카트 디코더는 SegFormer 스타일 디코더 대비 mIoU를 0.2% 향상시켜 스테이지 간 특징 융합의 효과를 입증했다.
- ADE20K에서 IncepFormer는 정확도와 효율성 측면에서 Swin Transformer, SETR, SegFormer를 모두 능가하는 최고의 성능-파라미터 균형을 달성했다.
- 정성적 결과 분석에서 IncepFormer는 특히 복잡한 도시 환경에서 SegFormer보다 더 선명하고 정확한 세분화 마스크를 생성하는 것으로 나타났다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.