[논문 리뷰] S$^2$-FPN: Scale-ware Strip Attention Guided Feature Pyramid Network for Real-time Semantic Segmentation
이 논문은 스케일 인식 스트립 어텐션과 어텐션 기반 피처 피라미드 융합 모듈을 사용하여 다중 척도 피처 표현을 향상시키면서도 계산 비용을 감소시키는 경량 실시간 세분화 네트워크인 S²-FPN을 제안한다. 이 방법은 상태 기반 정확도/속도 트레이드오프를 달성하여 Cityscapes에서 30.5 FPS에서 77.8% mIoU, Camvid에서 55.5 FPS에서 74.2% mIoU를 기록하며 실시간 성능을 위해 효율적인 어텐션 메커니즘과 피처 융합 전략을 활용한다.
Modern high-performance semantic segmentation methods employ a heavy backbone and dilated convolution to extract the relevant feature. Although extracting features with both contextual and semantic information is critical for the segmentation tasks, it brings a memory footprint and high computation cost for real-time applications. This paper presents a new model to achieve a trade-off between accuracy/speed for real-time road scene semantic segmentation. Specifically, we proposed a lightweight model named Scale-aware Strip Attention Guided Feature Pyramid Network (S$^2$-FPN). Our network consists of three main modules: Attention Pyramid Fusion (APF) module, Scale-aware Strip Attention Module (SSAM), and Global Feature Upsample (GFU) module. APF adopts an attention mechanisms to learn discriminative multi-scale features and help close the semantic gap between different levels. APF uses the scale-aware attention to encode global context with vertical stripping operation and models the long-range dependencies, which helps relate pixels with similar semantic label. In addition, APF employs channel-wise reweighting block (CRB) to emphasize the channel features. Finally, the decoder of S$^2$-FPN then adopts GFU, which is used to fuse features from APF and the encoder. Extensive experiments have been conducted on two challenging semantic segmentation benchmarks, which demonstrate that our approach achieves better accuracy/speed trade-off with different model settings. The proposed models have achieved a results of 76.2\%mIoU/87.3FPS, 77.4\%mIoU/67FPS, and 77.8\%mIoU/30.5FPS on Cityscapes dataset, and 69.6\%mIoU,71.0\% mIoU, and 74.2\% mIoU on Camvid dataset. The code for this work will be made available at \url{https://github.com/mohamedac29/S2-FPN
연구 동기 및 목표
- 실시간 응용 프로그램에서 고성능 세분화 모델의 높은 계산 비용과 메모리 사용량 문제를 해결하기 위해.
- 피처 피라미드 네트워크에서 피처 레벨 간의 의미적 간극을 줄임으로써 다중 척도 피처 표현을 향상시키기 위해.
- 최소한의 계산 오버헤드로 장거리 의존성을 모델링할 수 있는 효율적인 어텐션 메커니즘을 설계하기 위해.
- 경량 아키텍처와 효과적인 피처 융합을 통해 실시간 도로 환경 세분화에서 뛰어난 정확도/속도 트레이드오프를 달성하기 위해.
- 절단 및 벤치마크 비교를 통해 스케일 인식 스트립 어텐션과 어텐션 피라미드 융합의 효과를 검증하기 위해.
제안 방법
- 장거리 의존성을 효율적으로 모델링하기 위해 수직 스트립 연산과 스케일 인식 어텐션을 사용하는 스케일 인식 스트립 어텐션 모듈(SSFAM)을 제안한다.
- 채널별 재가중 및 어텐션 메커니즘을 사용하여 다중 척도 피처를 융합함으로써 의미적 간극을 줄이는 어텐션 피라미드 융합(APF) 모듈을 도입한다.
- 강화된 세분화 출력을 위해 인코더와 디코더 피처를 결합하기 위해 글로벌 피처 업샘플(GFU) 모듈을 활용한다.
- 고속 추론 속도를 유지하기 위해 경량 백본(예: ResNet18/34)과 S²-FPN 헤드를 조합한다.
- 전체 어텐션 맵 대신 수직 스트립 연산을 활용하여 공간적 및 채널 어텐션을 적용함으로써 FLOPs를 감소시킨다.
- 정확도와 속도의 균형을 맞추기 위해 입력 해상도 제어 및 스트라이드 조정을 통해 네트워크를 최적화한다.
실험 결과
연구 질문
- RQ1경량 어텐션 메커니즘이 최소한의 계산 비용으로 세분화에서 장거리 의존성을 효과적으로 모델링할 수 있는가?
- RQ2표준 FPN 또는 옆으로 연결된 연결 방식과 비교해 스케일 인식 스트립 어텐션은 다중 척도 피처 융합을 어떻게 향상시키는가?
- RQ3어텐션 피라미드 융합(APF) 모듈이 피처 피라미드의 피처 레벨 간 의미적 간극을 어느 정도 감소시키는가?
- RQ4S²-FPN은 Cityscapes와 Camvid와 같은 표준 벤치마크에서 어떤 정확도/속도 트레이드오프를 달성하는가?
- RQ5스테이지 2의 스트라이드를 1로 교체하면 추론 시간을 크게 증가시키지 않고 성능 향상을 이룰 수 있는가?
주요 결과
- ResNet18를 사용할 때 S²-FPN는 Cityscapes에서 87.3 FPS에서 76.2% mIoU를 기록하여 뛰어난 속도-정확도 트레이드오프를 보였다.
- ResNet34를 사용할 경우, 모델은 67 FPS에서 77.4% mIoU를 달성하여 정확도는 향상되었고 속도는 다소 감소하였다.
- 스테이지 2의 스트라이드를 1로 교체한 S²-FPN34M 버전은 30.5 FPS에서 77.8% mIoU를 기록하여 아키텍처 정교화로 인한 뚜렷한 성능 향상을 보였다.
- Camvid에서는 S²-FPN18가 124.2 FPS에서 69.6% mIoU를 기록했고, S²-FPN34M는 55.5 FPS에서 74.2% mIoU를 달성하여 이전의 경량 모델을 능가했다.
- 절단 연구 결과, 스케일 인식 스트립 어텐션과 APF 모듈이 성능 향상에 뚜렷한 기여를 했다는 것이 확인되었다.
- mIoU 측면에서 BiSeNetV2와 STDC-Seg과 같은 최신 기술을 능가하면서도 경쟁 가능한 추론 속도를 유지했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.