[논문 리뷰] Real-Time High-Performance Semantic Image Segmentation of Urban Street Scenes
이 논문은 경량 네트워크와 어트로스 컨볼루션, 어텐션을 활용한 LBN-AA를 사용하여 도시 스트리트 샷에 대한 실시간 고성능 의미 분할 방법을 제안한다. 또한 DASPP, SPN, FFN을 포함한다. 단일 NVIDIA TITAN X를 사용하여 Cityscapes에서 51.0 fps에서 73.6% mIoU, CamVid에서 39.3 fps에서 68.0% mIoU를 달성하여 정확도-속도 트레이드오프가 뛰어나다.
Deep Convolutional Neural Networks (DCNNs) have recently shown outstanding performance in semantic image segmentation. However, state-of-the-art DCNN-based semantic segmentation methods usually suffer from high computational complexity due to the use of complex network architectures. This greatly limits their applications in the real-world scenarios that require real-time processing. In this paper, we propose a real-time high-performance DCNN-based method for robust semantic segmentation of urban street scenes, which achieves a good trade-off between accuracy and speed. Specifically, a Lightweight Baseline Network with Atrous convolution and Attention (LBN-AA) is firstly used as our baseline network to efficiently obtain dense feature maps. Then, the Distinctive Atrous Spatial Pyramid Pooling (DASPP), which exploits the different sizes of pooling operations to encode the rich and distinctive semantic information, is developed to detect objects at multiple scales. Meanwhile, a Spatial detail-Preserving Network (SPN) with shallow convolutional layers is designed to generate high-resolution feature maps preserving the detailed spatial information. Finally, a simple but practical Feature Fusion Network (FFN) is used to effectively combine both shallow and deep features from the semantic branch (DASPP) and the spatial branch (SPN), respectively. Extensive experimental results show that the proposed method respectively achieves the accuracy of 73.6% and 68.0% mean Intersection over Union (mIoU) with the inference speed of 51.0 fps and 39.3 fps on the challenging Cityscapes and CamVid test datasets (by only using a single NVIDIA TITAN X card). This demonstrates that the proposed method offers excellent performance at the real-time speed for semantic segmentation of urban street scenes.
연구 동기 및 목표
- 도시 스트리트 샷에서 높은 의미 분할 정확도를 확보하면서도 실시간 추론 속도를 유지하는 데 도전하는 것.
- 경량이고 효율적인 네트워크 아키텍처를 설계하여 계산 복잡도를 감소시키되 분할 성능을 훼손하지 않는 것.
- 복잡한 도시 환경에서 다중 척도 객체 검출을 효과적으로 처리하고 세밀한 공간적 세부 정보를 유지하는 것.
- 고수준 의미 이해와 저수준 공간 정밀도를 균형 잡는 강력한 종단 간 프레임워크를 개발하는 것.
제안 방법
- LBN-AA 네트워크는 어트로스 컨볼루션과 컨볼루션 어텐션 모듈을 활용한 경량 백본을 사용하여 조밀한 특징 맵을 효율적으로 추출한다.
- DASPP 모듈은 다양한 어트로스 풀링 비율을 적용하여 다중 척도에서 다양한 맥락적 및 의미적 정보를 인코딩한다.
- SPN은 얕은 컨볼루션 레이어를 활용하여 깊은 네트워크에서 손실된 고해상도 공간 세부 정보를 유지한다.
- FFN은 연결 및 정제를 통해 DASPP에서 유래한 고수준 의미 특징과 SPN에서 유래한 고해상도 공간 특징을 융합한다.
- 전체 모델은 종단 간 최적화되어 특징 호환성과 분할 정확도를 보장한다.
- 어트로스 컨볼루션을 전반적으로 사용하여 공간 해상도를 유지하면서的感受 field를 확장한다.
실험 결과
연구 질문
- RQ1경량 실시간 의미 분할 모델이 복잡한 도시 스트리트 샷에서 높은 정확도를 달성할 수 있는가?
- RQ2계산 비용을 증가시키지 않고 다중 척도 맥락 정보를 효과적으로 캡처할 수 있는가?
- RQ3딥 의미 분할 네트워크에서 공간 세부 정보 유지가 얼마나 향상될 수 있는가?
- RQ4실시간 분할에서 고수준 의미 특징과 저수준 공간 특징을 융합하는 최적의 전략은 무엇인가?
주요 결과
- 제안된 방법은 단일 NVIDIA TITAN X를 사용하여 Cityscapes 테스트 세트에서 51.0 fps에서 73.6% mIoU를 달성하여 실시간 성능을 입증한다.
- CamVid 데이터셋에서 39.3 fps에서 68.0% mIoU를 달성하여 여러 최첨단 빠른 분할 모델보다 정확도에서 뛰어난 성능을 보였다.
- 표지판과 기둥과 같은 작은 객체 분할에서 뛰어난 성능을 보였으며, CamVid에서 'sign' 클래스의 mIoU가 51.6%였다.
- 비록 더 느리지만 BiSeNet2(68.7% mIoU)보다 CamVid에서 더 높은 정확도를 달성하여 강력한 성능 트레이드오프를 보였다.
- 수목 분할에서는 외관의 변동성과 배경과의 유사성으로 인해 어려움을 겪었으며, 'tree' 클래스의 mIoU는 오직 70.5%에 그쳤다.
- 정성적 결과는 오염 및 조명 변화를 효과적으로 처리하지만, 가끔 객체 내부를 과도하게 분할하거나 부족하게 분할하는 경향이 있음을 보여주었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.