Skip to main content
QUICK REVIEW

[논문 리뷰] Real-time Semantic Segmentation with Fast Attention

Ping Hu, Federico Perazzi|arXiv (Cornell University)|2020. 07. 07.
Advanced Neural Network Applications참고 문헌 58인용 수 6
한 줄 요약

이 논문은 선형 계산 비용으로 장거리 문맥적 의존성을 효율적으로 포착할 수 있는 새로운 빠른 공간 주의 메커니즘을 사용하는 실시간 세분화 모델인 Fast Attention Network(FANet)을 제안한다. 이는 고해상도 이미지 및 영상에서 높은 정확도를 달성할 수 있게 한다. FANet는 Cityscapes에서 72 FPS에서 75.5% mIoU를 달성하며, 이는 이전 방법 대비 약 50% 빠른 속도로 상태최신 정확도를 유지한다.

ABSTRACT

In deep CNN based models for semantic segmentation, high accuracy relies on rich spatial context (large receptive fields) and fine spatial details (high resolution), both of which incur high computational costs. In this paper, we propose a novel architecture that addresses both challenges and achieves state-of-the-art performance for semantic segmentation of high-resolution images and videos in real-time. The proposed architecture relies on our fast spatial attention, which is a simple yet efficient modification of the popular self-attention mechanism and captures the same rich spatial context at a small fraction of the computational cost, by changing the order of operations. Moreover, to efficiently process high-resolution input, we apply an additional spatial reduction to intermediate feature stages of the network with minimal loss in accuracy thanks to the use of the fast attention module to fuse features. We validate our method with a series of experiments, and show that results on multiple datasets demonstrate superior performance with better accuracy and speed compared to existing approaches for real-time semantic segmentation. On Cityscapes, our network achieves 74.4$\%$ mIoU at 72 FPS and 75.5$\%$ mIoU at 58 FPS on a single Titan X GPU, which is~$\sim$50$\%$ faster than the state-of-the-art while retaining the same accuracy.

연구 동기 및 목표

  • 세분화에서 높은 정확도와 실시간 추론 간의 상충 관계를 해결하기 위해 풍부한 공간적 맥락과 세밀한 세부 정보를 효율적으로 포착하는 것.
  • 딥 네트워크에서 자기주의 메커니즘의 계산 비용을 공간적 또는 맥락적 정보 손실 없이 감소시키는 것.
  • 입력 이미지의 해상도를 낮추는 대신 중간 특징 단계에서 공간 감소를 적용하여 고해상도 입력의 실시간 처리를 가능하게 하는 것.
  • 고정된 계산 비용으로 시간적 윈도우 크기에 관계없이 공간-시간 맥락 모델링이 가능한 빠른 주의 메커니즘을 영상 세분화에 확장하는 것.

제안 방법

  • 자기주의에서 소프트맥스 정규화를 코사인 유사도로 대체하는 빠른 공간 주의 모듈을 도입하여 복잡도를 O(n²c)에서 O(nc²)로 감소시킴.
  • 행렬 곱셈의 결합법칙을 활용해 주의 맵을 효율적으로 계산하여, n ≫ c일 경우 표준 자기주의 대비 약 n/c의 속도 향상을 달성함.
  • 입력 이미지가 아닌 중간 특징 맵에 공간 감소를 적용하여 고해상도 공간 세부 정보를 유지하면서 FLOPs를 감소시킴.
  • 깊은 단계에서 浅단계로 향하는 캐스케이드 특징 융합 전략을 사용하여 최종 예측을 위한 맥락적 정보와 세부 정보를 통합함.
  • 시간 윈도우 크기에 관계없이 일정한 계산 비용을 유지하는 조건에서, 영상 입력에 대해 빠른 주의 메커니즘을 공간-시간 맥락으로 일반화함.
  • 빠른 주의 메커니즘과 속도-정확도 트레이드오프에 최적화된 FANet-18 및 FANet-34 버전을 갖춘 경량 인코더-디코더 아키텍처를 활용함.

실험 결과

연구 질문

  • RQ1실시간 세분화를 위한 계산 비용을 크게 줄이면서도 풍부한 공간적 맥락을 유지할 수 있는 수정된 주의 메커니즘을 설계할 수 있는가?
  • RQ2FLOPs를 증가시키지 않고도 실시간 모델에서 고해상도 공간 세부 정보를 어떻게 유지할 수 있는가?
  • RQ3입력 이미지의 해상도를 낮추는 것보다 중간 특징 맵의 공간 감소가 정확도와 효율성 측면에서 더 우수한 성능을 낼 수 있는가?
  • RQ4빠른 주의 메커니즘을 최소한의 계산 오버헤드로 영상 세분화에 확장할 수 있는가?
  • RQ5빠른 주의 메커니즘과 공간 감소를 조합하면 실시간 세분화에서 속도와 정확도 양면에서 상태최신 성능을 달성할 수 있는가?

주요 결과

  • FANet는 단일 Titan X GPU를 사용하여 Cityscapes에서 72 FPS에서 74.4% mIoU, 58 FPS에서 75.5% mIoU를 달성하며, 이는 이전의 최상위 방법들 대비 약 50% 빠른 추론 속도를 기록함.
  • CamVid에서 FANet-18은 142 FPS에서 29.5% mIoU를 달성하여 BiseNet과 ICNet 모두보다 정확도와 속도에서 뛰어남.
  • COCO-Stuff에서 FANet-34는 640×640 해상도에서 142 FPS에서 29.5% mIoU를 달성하며, ICNet를 정확도와 속도 모두에서 능가함.
  • 빠른 주의 메커니즘의 공간-시간 확장(FANet+Temp)은 Cityscapes 영상에서 58 FPS에서 76.7% mIoU를 달성하며, PEARL 대비 40배 빠르고 Netwarp 대비 200배 높은 효율성을 확보함.
  • FANet-18+Temp는 평균 14ms의 추론 시간으로 72 FPS에서 75.5% mIoU를 달성하여 낮은 지연과 높은 처리량을 입증함.
  • 제거 실험 결과, 빠른 주의 메커니즘과 함께 중간 특징 감소 전략이 정확도를 유지하면서 FLOPs를 감소시킴을 확인하여 고해상도 입력 처리에 효과적임을 입증함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.