[논문 리뷰] LRNNet: A Light-Weighted Network with Efficient Reduced Non-Local Operation for Real-Time Semantic Segmentation
LRNNet는 효율적인 특징 추출을 위한 인수 분해 컨볼루션 블록(FCB)과 지역 특이 벡터 기반의 축소된 비국소 모듈(SVN)을 사용하여 저비용으로 장거리 의존성을 모델링하는 경량 실시간 세분화 네트워크를 제안한다. 이는 GTX 1080Ti에서 0.68M 파라미터와 71 FPS로 Cityscapes에서 72.2% mIoU를 달성하며 정확도, 속도, 모델 크기, 효율성 간의 새로운 최고 성능 트레이드오프를 설정한다.
The recent development of light-weighted neural networks has promoted the applications of deep learning under resource constraints and mobile applications. Many of these applications need to perform a real-time and efficient prediction for semantic segmentation with a light-weighted network. This paper introduces a light-weighted network with an efficient reduced non-local module (LRNNet) for efficient and realtime semantic segmentation. We proposed a factorized convolutional block in ResNet-Style encoder to achieve more lightweighted, efficient and powerful feature extraction. Meanwhile, our proposed reduced non-local module utilizes spatial regional dominant singular vectors to achieve reduced and more representative non-local feature integration with much lower computation and memory cost. Experiments demonstrate our superior trade-off among light-weight, speed, computation and accuracy. Without additional processing and pretraining, LRNNet achieves 72.2% mIoU on Cityscapes test dataset only using the fine annotation data for training with only 0.68M parameters and with 71 FPS on a GTX 1080Ti card.
연구 동기 및 목표
- 모바일 및 자원 제약이 있는 애플리케이션에 적합한 경량 실시간 세분화 네트워크를 개발하기 위해.
- 단기적 및 장기적 특징을 별도로 처리하는 인수 분해 컨볼루션 블록(FCB)을 설계하여 특징 추출의 효율성을 향상시키기 위해.
- 비국소 연산의 계산 및 메모리 비용을 줄이면서도 세분화 작업에서 전역적 맥락 모델링을 유지하기 위해.
- 모델 크기, 추론 속도, 계산 비용, 세분화 정확도 간의 우수한 트레이드오프를 달성하기 위해.
제안 방법
- 제안된 인수 분해 컨볼루션 블록(FCB)은 깊이 분리형 컨볼루션과 채널 별 인수 분해를 사용하여 파라미터와 계산량을 줄이면서도 강력한 특징 표현 능력을 유지한다.
- 축소된 비국소 모듈(SVN)은 공간 영역에서 주요 특이 벡터를 활용하여 대표적인 특징을 추출함으로써 키와 값의 수를 줄이고 계산 복잡도를 낮춘다.
- SVN 모듈은 주요 특이 벡터를 효율적으로 계산하기 위해 거듭제곱 반복 기법을 적용하여 전체 쌍방향 어텐션 없이도 저비용으로 전역 특징 통합을 가능하게 한다.
- 에코더는 FCB로 구성된 ResNet 스타일 아키텍처를 사용하며, 디코더는 전역 맥락을 통합하여 특징을 정밀하게 보정하기 위해 SVN 모듈을 통합한다.
- 모델은 사전 훈련 없이 Cityscapes와 CamVid의 정밀한 애너테이션만을 사용하여 엔드 투 엔드로 훈련된다.
- 모델 효율성은 표준 벤치마크에서 추론 속도(FPS), 파라미터 수(Para), FLOPS(GFLOPS)를 통해 평가된다.
실험 결과
연구 질문
- RQ1경량 네트워크에서 인수 분해 컨볼루션 블록이 단기적 및 장기적 특징 학습 간의 균형을 효과적으로 유지할 수 있는가?
- RQ2지역 특이 벡터 기반의 축소된 비국소 모듈이 전체 비국소 연산에 비해 훨씬 낮은 계산 비용으로 유사한 전역 맥락 모델링 성능을 달성할 수 있는가?
- RQ3이러한 모듈을 경량 에코더-디코더 아키텍처에 통합함으로써 정확도, 속도, 모델 크기 측면에서 최고 수준의 성능을 달성할 수 있는가?
- RQ4제안된 네트워크는 사전 훈련 없이도 Cityscapes와 CamVid에서 높은 정확도를 달성할 수 있는가?
주요 결과
- LRNNet는 GTX 1080Ti에서 0.68만 개의 파라미터와 71 FPS로 Cityscapes 테스트 세트에서 72.2% mIoU를 달성하여 효율성과 정확도 간의 새로운 최고 수준의 트레이드오프를 입증한다.
- 단일 스케일 SVN(Model B)은 풀링 기반 방법보다 mIoU를 0.5% 향상시켜 8.57 GFLOPS의 최소한의 계산 증가로 71.6% mIoU를 달성한다.
- 다중 스케일 SVN(Model C)는 Cityscapes에서 성능을 더욱 향상시켜 72.2% mIoU를 달성하면서도 높은 속도와 낮은 파라미터 수를 유지한다.
- CamVid에서는 0.68M 파라미터와 76.5 FPS로 69.2% mIoU를 기록하여 다양한 데이터셋에 대한 뛰어난 일반화 능력을 보였다.
- FCB 기반 에코더는 모델 크기와 계산량을 줄였으며, ERFNet과 LEDNet보다 정확도와 효율성 측면에서 뛰어난 성능을 보였다.
- SVN에서 지역 주요 특이 벡터를 사용함으로써 최대 풀링 또는 평균 풀링보다 더 대표적인 특징을 제공하며, 특히 경량 설정에서 유의미한 성능 향상을 이룬다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.