[논문 리뷰] PP-LiteSeg: A Superior Real-Time Semantic Segmentation Model
PP-LiteSeg는 Flexible and Lightweight Decoder (FLD), Unified Attention Fusion Module (UAFM), Simple Pyramid Pooling Module (SPPM)의 세 모듈을 도입하여 Cityscapes와 CamVid에서 실시간 의미 분할에 대한 최첨단 정확도-속도 트레이드오프를 달성합니다. Cityscapes 테스트에서 273.6 FPS에서 72.0% mIoU, CamVid 테스트에서 154.8 FPS에서 75.0% mIoU를 보고합니다.
Real-world applications have high demands for semantic segmentation methods. Although semantic segmentation has made remarkable leap-forwards with deep learning, the performance of real-time methods is not satisfactory. In this work, we propose PP-LiteSeg, a novel lightweight model for the real-time semantic segmentation task. Specifically, we present a Flexible and Lightweight Decoder (FLD) to reduce computation overhead of previous decoder. To strengthen feature representations, we propose a Unified Attention Fusion Module (UAFM), which takes advantage of spatial and channel attention to produce a weight and then fuses the input features with the weight. Moreover, a Simple Pyramid Pooling Module (SPPM) is proposed to aggregate global context with low computation cost. Extensive evaluations demonstrate that PP-LiteSeg achieves a superior trade-off between accuracy and speed compared to other methods. On the Cityscapes test set, PP-LiteSeg achieves 72.0% mIoU/273.6 FPS and 77.5% mIoU/102.6 FPS on NVIDIA GTX 1080Ti. Source code and models are available at PaddleSeg: https://github.com/PaddlePaddle/PaddleSeg.
연구 동기 및 목표
- 실세계 응용에 적합한 고정밀 실시간 의미 분할 필요성 대응
- 인코더-디코더 효율을 균형 있게 유지하면서 디코더 계산 축소
- 주의 지시적 융합을 통해 특징 표현 강화
- 낮은 계산 비용으로 글로벌 컨텍스트 효율적으로 축적
- Cityscapes와 CamVid 데이터셋에서 최첨단 트레이드오프 시연
제안 방법
- 고수준에서 저수준 특징으로 점진적으로 특징 채널을 줄이는 Flexible and Lightweight Decoder (FLD) 도입
- 공간 및 채널 어텐션을 사용하여 융합 가중치를 생성하고 mul-add 연산으로 특징을 융합하는 Unified Attention Fusion Module (UAFM) 제안
- 전달 단계의 중간 채널/출력 채널을 감소시키고 연결 대신 더하는 방식으로 글로벌 컨텍스트를 축적하는 Simple Pyramid Pooling Module (SPPM) 설계
- 저비용으로 장거리 의존성을 모델링하는 SPPM 채택
- 인코더(STDC 기반), SPPM, FLD로 구성된 PP-LiteSeg를 구축하고, 교차 엔트로피 및 Online Hard Example Mining으로 학습
실험 결과
연구 질문
- RQ1가벼운 디코더 설계가 고정밀 분할 정확도를 유지하면서 인코더-디코더 계산을 균형 있게 맞출 수 있는가?
- RQ2단일화된 어텐션 기반 융합 모듈이 다중 레벨 융합에서 특징 표현을 효율적으로 향상시키는가?
- RQ3저비용 글로벌 컨텍스트 모듈(SPPM)이 실시간 성능에 악영향 없이 정확도를 유지하거나 향상시킬 수 있는가?
- RQ4기존 방법과 비교하여 표준 실시간 분할 벤치마크(Cityscapes, CamVid)에서 PP-LiteSeg의 성능 트레이드오프는 어떻게 되는가?
주요 결과
- PP-LiteSeg는 Cityscapes에서 강력한 정확도-속도 트레이드오프를 달성하며 PP-LiteSeg-T1의 테스트 세트에서 273.6 FPS에 72.0% mIoU를 보고하고 PP-LiteSeg-B2의 테스트 세트에서 102.6 FPS에 77.5% mIoU를 보고합니다.
- Cityscapes에서 PP-LiteSeg-B2는 768×1536 해상도에서 102.6 FPS로 78.2% mIoU에 도달하며, 다른 실시간 방법과 비교합니다.
- CamVid에서 PP-LiteSeg-T는 222.3 FPS를 달성하고 PP-LiteSeg-B는 154.8 FPS에서 75.0% mIoU를 기록합니다.
- 개벌 연구에서 FLD가 기준치 대비 mIoU를 0.17% 향상시키고, FLD를 SPPM 및 UAFM과 결합하면 점진적 이득을 얻어 최종적으로 PP-LiteSeg-B2에서 102.6 FPS에 78.21 mIoU에 도달합니다.
- 제안된 모듈들은 Cityscapes와 CamVid 전반에 걸쳐 정확도와 속도 사이의 최첨단 균형을 제공한다는 것을 보여줍니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.