[논문 리뷰] ESNet: An Efficient Symmetric Network for Real-time Semantic Segmentation
ESNet는 기존의 병렬 분해형 컨볼루션 유닛(PFCU)을 도입한 경량이며 대칭적인 인코더-디코더 네트워크를 제안하여 계산 비용을 줄이면서도 특징 표현 능력을 유지함으로써 실시간 세분화 분석을 위한 새로운 기준을 설정한다. 단일 GTX 1080Ti에서 160만 개의 파라미터로도 62 FPS를 달성하며, CityScapes 데이터셋에서 기존 경량 모델들보다 뛰어난 정확도-효율성 트레이드오프를 달성한다.
The recent years have witnessed great advances for semantic segmentation using deep convolutional neural networks (DCNNs). However, a large number of convolutional layers and feature channels lead to semantic segmentation as a computationally heavy task, which is disadvantage to the scenario with limited resources. In this paper, we design an efficient symmetric network, called (ESNet), to address this problem. The whole network has nearly symmetric architecture, which is mainly composed of a series of factorized convolution unit (FCU) and its parallel counterparts (PFCU). On one hand, the FCU adopts a widely-used 1D factorized convolution in residual layers. On the other hand, the parallel version employs a transform-split-transform-merge strategy in the designment of residual module, where the split branch adopts dilated convolutions with different rate to enlarge receptive field. Our model has nearly 1.6M parameters, and is able to be performed over 62 FPS on a single GTX 1080Ti GPU. The experiments demonstrate that our approach achieves state-of-the-art results in terms of speed and accuracy trade-off for real-time semantic segmentation on CityScapes dataset.
연구 동기 및 목표
- 드론, 로봇, 스마트폰과 같은 자원 제약이 있는 장치에 정확한 세분화 분석 모델을 구현하는 데 도전한다.
- 특히 실시간 추론에서 정확도를 훼손하지 않으면서 계산 복잡도와 모델 크기를 줄인다.
- 새로운 잔차 블록 설계를 통해 높은 특징 표현 능력을 유지하면서도 대칭적이고 효율적인 아키텍처를 설계한다.
- 기존의 경량 네트워크들과 비교해 속도, 정확도, 모델의 압축성 간의 우수한 균형을 달성한다.
제안 방법
- 잔차 블록 기반의 거의 대칭적인 인코더-디코더 아키텍처를 사용하며, 특징 계층을 위한 다운샘플링 및 업샘플링 유닛을 포함한다.
- 핵심 구성 요소는 병렬 분해형 컨볼루션 유닛(PFCU)으로, 2D 컨볼루션을 다수의 병렬 경로를 통해 1D 분해형 컨볼루션으로 분해하기 위해 변환-분할-변환-병합 전략을 적용한다.
- PFCU는 식별 흐름과 다양한 확장률을 가진 다중 경로 1D 컨볼루션을 통합하여 수용 영역을 확장하면서도 FLOPs를 줄인다.
- 분해형 컨볼루션 유닛(FCU)은 적응형 커널 크기를 가진 1D 분해형 컨볼루션을 사용하여 다중 스케일 특징을 효율적으로 캡처한다.
- 아키텍처는 엔드 투 엔드로 훈련 가능하며, 기존의 ResNet 기반의 세분화 및 분류 네트워크에 직접 적용할 수 있다.
- 이 설계는 상당한 파라미터 감소와 함께 정확도 저하 최소화로 빠른 추론을 가능하게 한다.
실험 결과
연구 질문
- RQ1대칭적이고 경량화된 네트워크 아키텍처가 엣지 장치에서 실시간 추론 속도를 유지하면서도 높은 세분화 정확도를 달성할 수 있는가?
- RQ2PFCU의 변환-분할-변환-병합 전략이 표준 2D 컨볼루션에 비해 특징 표현 효율성을 어떻게 향상시키는가?
- RQ3분해형 및 병렬 컨볼루션 설계를 사용할 경우 모델 크기, 추론 속도, 세분화 mIOU 간의 트레이드오프는 어떻게 되는가?
- RQ4ENet, ESPNet, CGNet과 같은 최신 경량 네트워크와 비교해 ESNet은 정확도와 속도 측면에서 어떻게 성능을 냈는가?
주요 결과
- 단일 GTX 1080Ti GPU에서 ESNet은 160만 개의 파라미터로 62 FPS의 추론 속도를 달성하며, 속도와 모델 크기 측면에서 SegNet을 크게 앞서간다.
- CityScapes 검증 세트에서 ESNet은 데이터 증강 없이도 69.1%의 클래스 mIOU와 69.1%의 카테고리 mIOU를 기록했으며, 클래스 mIOU는 ICNet보다 0.4% 낮지만 카테고리 mIOU는 더 높다.
- 2만 개의 추가적인 굵은 레이블을 사용할 경우, ESNet은 70.7%의 클래스 mIOU와 87.4%의 카테고리 mIOU를 달성하여 정확도-효율성 트레이드오프에서 새로운 최고 기록을 수립한다.
- ESNet은 SegNet 대비 약 4배 빠르고 18배 작으며, ENet보다 파라미터 수가 5배 많지만 클래스 mIOU는 12.4%, 카테고리 mIOU는 7% 높은 성능을 기록한다.
- 시각적 결과는 ESNet이 다양한 객체 크기에 걸쳐 잘 일반화되며, 특히 교통 표지판과 신호등과 같은 작은 객체 탐지에서 성능 향상을 보임을 보여준다.
- PFCU 설계 덕분에 FLOPs가 감소한 효율적인 추론이 가능하며, 대칭 아키텍처는 학습과 추론을 단순화하면서도 높은 성능을 유지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.