Skip to main content
QUICK REVIEW

[논문 리뷰] FDDWNet: A Lightweight Convolutional Neural Network for Real-time Sementic Segmentation

Jia Liu, Quan Zhou|arXiv (Cornell University)|2019. 11. 02.
Advanced Neural Network Applications참고 문헌 26인용 수 4
한 줄 요약

FDDWNet는 인해 깊이 있는 인코더-디코더 컨volution 네트워크로, 요소 분해된 확장된 깊이 분리형 컨볼루션(FDDWC)과 다중 지점 스케일 연결을 사용하여 최소한의 파라미터로 높은 정확도를 달성한다. FDDWNet은 단일 RTX 2080Ti GPU에서 60 FPS의 추론 속도와 CityScapes에서 71.5% mIoU 성능을 기록하며, 기존 경량 모델 대비 속도-정확도 트레이드오프에서 뛰어난 성능을 보인다.

ABSTRACT

This paper introduces a lightweight convolutional neural network, called FDDWNet, for real-time accurate semantic segmentation. In contrast to recent advances of lightweight networks that prefer to utilize shallow structure, FDDWNet makes an effort to design more deeper network architecture, while maintains faster inference speed and higher segmentation accuracy. Our network uses factorized dilated depth-wise separable convolutions (FDDWC) to learn feature representations from different scale receptive fields with fewer model parameters. Additionally, FDDWNet has multiple branches of skipped connections to gather context cues from intermediate convolution layers. The experiments show that FDDWNet only has 0.8M model size, while achieves 60 FPS running speed on a single RTX 2080Ti GPU with a 1024x512 input image. The comprehensive experiments demonstrate that our model achieves state-of-the-art results in terms of available speed and accuracy trade-off on CityScapes and CamVid datasets.

연구 동기 및 목표

  • 엣지 디바이스에서 실시간 응용 프로그램의 모델 효율성과 세그멘테이션 정확도 사이의 트레이드오프를 해결하기 위해.
  • 빠른 추론 속도를 유지하면서도 특징 표현 능력을 향상시키기 위해 더 깊은 경량 네트워크 아키텍처를 설계하기 위해.
  • 세그멘테이션 성능을 훼손하지 않으면서 모델 크기와 계산 비용을 감소시키기 위해.
  • 더 적은 파라미터로 다중 척도 수용 영역 학습을 위한 요소 분해된 확장된 깊이 분리형 컨볼루션(FDDWC)의 활용을 탐색하기 위해.
  • 중간 레이어에서 유도된 다중 지점 스케일 연결을 통합하여 맥락 집약 및 모델의 강건성을 향상시키기 위해.

제안 방법

  • 파라미터 수를 줄이고 높은 표현 능력을 유지하기 위해 요소 분해된 확장된 깊이 분리형 컨볼루션(FDDWC)을 사용하는 초경량 잔차 모듈(EERM)을 제안한다.
  • 표준 컨볼루션을 확장된 1D 요소 분해된 깊이 분리형 컨볼루션 두 개로 분해한 후, 1×1 포인트와이즈 컨볼루션을 적용한다.
  • 중간 레이어에서 유도된 다중 지점 스케일 연결을 도입하여 맥락 특징을 집약하고 기울기 흐름을 향상시킨다.
  • EERM에서 아이덴티티 매핑을 사용하는 엔드 투 엔드 학습 가능한 아키텍처를 적용하여 기울기 소실/폭발 문제를 방지한다.
  • CityScapes 및 CamVid 데이터셋에서 안정적인 학습을 위해 모멘터럼과 가중치 감쇠를 적용한 'poly' 학습률 정책을 적용한다.
  • 작은 배치 크기(4)와 효율적인 레이어 설계를 통해 추론 속도를 최적화하여 단일 RTX 2080Ti에서 60 FPS를 달성한다.

실험 결과

연구 질문

  • RQ1더 깊은 경량 네트워크 아키텍처가 모델 크기나 추론 지연을 늘리지 않고도 더 높은 세그멘테이션 정확도를 달성할 수 있는가?
  • RQ2요소 분해된 확장된 깊이 분리형 컨볼루션(FDDWC)이 더 적은 파라미터로 다중 척도 특징을 효과적으로 학습하는 데 얼마나 유용한가?
  • RQ3중간 레이어에서 유도된 다중 지점 스케일 연결이 실시간 세그멘테이션에서 맥락 집약 및 성능에 미치는 영향은 어떠한가?
  • RQ4표준 벤치마크에서 최신 경량 모델 대비 FDDWNet의 속도-정확도 트레이드오프는 어떠한가?
  • RQ50.8M 파라미터를 가진 경량 네트워크가 데이터 증강 또는 후처리 없이 CityScapes와 CamVid에서 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • FDDWNet은 CityScapes 검증 세트에서 71.5% mIoU를 기록하여 대부분의 기존 경량 모델을 능가한다.
  • 1024×512 입력으로 단일 RTX 2080Ti GPU에서 60 FPS로 실행되어 실시간 추론 능력을 입증한다.
  • 모델은 단지 0.8M 파라미터를 가지며, ICNet 대비 53배 작고 거의 2배 빠른 성능을 기록한다.
  • CityScapes에서 19개 카테고리 중 13개에서 최고의 mIoU 성능을 기록했으며, 'Wall' 카테고리에서 6.1% 향상, 'Pedestrian'에서 2.7% 향상된 성과를 기록했다.
  • CamVid에서 FDDWNet은 66.9% mIoU 성능을 기록했고 79 FPS로 실행되어 ICNet 대비 빠른 속도를 기록했으며 정확도는 0.2% 뿐 감소했다.
  • 더 깊은 아키텍처임에도 불구하고, FDDWNet은 DABNet과 유사한 모델 크기를 유지하면서 거의 2배 깊은 네트워크 깊이를 달성하여 뛰어난 파라미터 효율성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.