Skip to main content
QUICK REVIEW

[논문 리뷰] ESPNet: Efficient Spatial Pyramid of Dilated Convolutions for Semantic Segmentation

Sachin Mehta, Mohammad Rastegari|arXiv (Cornell University)|2018. 03. 19.
AI in cancer detection인용 수 4
한 줄 요약

ESPNet은 공간 이중성 모듈(ESP)을 도입하여 점별 합성곱과 확장 합성곱을 조합함으로써 의미 분할의 속도를 높이고 모델 크기와 계산 비용을 줄인다. 이 네트워크는 GPU에서 112 FPS, 엣지 장치(Jetson TX2)에서 9 FPS를 기록하여 PSPNet 대비 22배 빠르고 180배 작으며, 정확도는 8% 뿐 낮게 유지하면서 MobileNet, ShuffleNet, ENet와 유사한 자원 제약 조건에서 뛰어난 성능을 발휘한다.

ABSTRACT

We introduce a fast and efficient convolutional neural network, ESPNet, for semantic segmentation of high resolution images under resource constraints. ESPNet is based on a new convolutional module, efficient spatial pyramid (ESP), which is efficient in terms of computation, memory, and power. ESPNet is 22 times faster (on a standard GPU) and 180 times smaller than the state-of-the-art semantic segmentation network PSPNet, while its category-wise accuracy is only 8% less. We evaluated ESPNet on a variety of semantic segmentation datasets including Cityscapes, PASCAL VOC, and a breast biopsy whole slide image dataset. Under the same constraints on memory and computation, ESPNet outperforms all the current efficient CNN networks such as MobileNet, ShuffleNet, and ENet on both standard metrics and our newly introduced performance metrics that measure efficiency on edge devices. Our network can process high resolution images at a rate of 112 and 9 frames per second on a standard GPU and edge device, respectively.

연구 동기 및 목표

  • 제한된 메모리, 계산 능력, 전력 자원을 가진 엣지 장치에 고정확도 의미 분할 모델을 구현하는 데 도전한다.
  • 정확도를 크게 훼손하지 않으면서 의미 분할 네트워크의 계산 및 메모리 부담을 줄인다.
  • 다양한 수용장치 스케일에서 효율적인 특징 학습을 가능하게 하는 새로운 합성곱 모듈을 개발한다.
  • 기존의 정확도와 FLOPs 외에 실질적인 엣지 장치 구현 성능을 평가하기 위한 새로운 시스템 수준의 성능 지표를 도입한다.
  • Cityscapes, PASCAL VOC, 전체 슬라이드 영상 등 다양한 데이터셋에서 제안된 모델의 일반화성과 강건성을 입증한다.

제안 방법

  • 표준 합성곱을 점별 합성곱과 확장 합성곱의 공간 이중성으로 분해하는 ESP(Efficient Spatial Pyramid) 모듈을 제안한다.
  • 채널 차원을 줄이기 위해 점별 합성곱을 사용하고, 증가하는 확장률을 가진 확장 합성곱을 통해 효과적인 수용장치를 다중 스케일로 확장한다.
  • 확장 합성곱에 의해 유도되는 격자 무늬 아티팩트를 완화하고 특징 표현을 향상시키기 위해 계층적 특징 융합(HFF)을 적용한다.
  • ESP 블록의 입력과 출력 사이에 스킵 연결을 통합하여 정보 흐름을 향상시키고 학습 안정성을 높인다.
  • ESP 모듈을 사용한 경량 인코더-디코더 아키텍처로서, 모델 크기를 크게 증가시키지 않으면서도 분할 정확도를 향상시키기 위한 경량 디코더를 통합한다.
  • 실제 엣지 장치 배포 성능을 평가하기 위해 GPU 주파수 민감도와 워프 실행 효율성과 같은 새로운 성능 지표를 도입한다.

실험 결과

연구 질문

  • RQ1의미 분할에 있어 최소한의 계산 비용으로 다중 스케일의 맥락 정보를 효율적으로 캡처할 수 있는 분해된 합성곱 모듈을 설계할 수 있는가?
  • RQ2ESP 모듈은 Inception 및 MobileNet과 같은 기존의 분해 모듈과 비교해 엣지 장치에서 정확도, 속도, 모델 크기 측면에서 어떻게 성능을 내는가?
  • RQ3입력 특징 맵의 공간 크기를 초월하는 효과적인 수용장치 크기의 영향을 받을 때, ESP 모듈의 정확도에 어떤 정도의 영향을 미치는가?
  • RQ4직접 스킵 연결을 통한 입력 강화는 모델 파rameter 수를 늘리지 않고도 특징 표현과 분할 정확도를 향상시킬 수 있는가?
  • RQ5GPU 주파수 민감도와 워프 실행 효율성과 같은 시스템 수준의 지표들이 엣지 하드웨어에서 실시간 추론 성능과 어떻게 상관관계를 가지는가?

주요 결과

  • ESPNet은 고성능 GPU에서 112 프레임/초, NVIDIA Jetson TX2 엣지 장치에서 9 프레임/초를 기록하여 실시간 추론 능력을 입증한다.
  • ESPNet은 PSPNet 대비 22배 빠르고 180배 작으며, 최첨단 수준의 정확도와 8% 이내로 유사한 정확도를 유지한다.
  • ESP 모듈은 점별 합성곱과 확장 합성곱을 순차적으로 사용함으로써 계산 비용을 줄이고 효율적인 다중 스케일 특징 학습을 가능하게 한다.
  • 입력 특징 맵의 차원 대비 너무 큰 수용장치 크기가 되는 경우(예: K > 5), 확장 합성곱 분기 수(K)를 늘일수록 정확도가 떨어진다.
  • 입력 강화와 경량 디코더의 추가로 정확도가 각각 2%와 6% 향상되었으며, 모델 크기 증가 폭은 미미하다(0.06 MB 및 20,000 파라미터).
  • ESPNet은 엣지 장치에서 표준 지표뿐 아니라 시스템 수준의 효율성 지표에서도 MobileNet, ShuffleNet, ENet, ERFNet을 모두 능가하여 뛰어난 일반화성과 효율성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.