[논문 리뷰] Efficient Hybrid Transformer: Learning Global-local Context for Urban Sence Segmentation.
이 논문은 실시간 도시 환경 세분화를 위한 효율적인 하이브리드 트랜스포머(EHT)를 제안한다. 이는 국소적 특징 추출을 위한 CNN 기반 인코더와 전역적 맥락 모델링을 위한 트랜스포머 기반 디코더를 조합한 것이다. EHT는 UAVid 테스트 세트에서 66.9%의 mIoU를 달성하며, 최신 경량 모델보다 빠른 추론 속도를 보이며, 효율성-정확도 균형에서 뛰어난 성능을 입증한다.
Semantic segmentation of fine-resolution urban scene images plays a vital role in extensive practical applications, such as land cover mapping, urban change detection, environmental protection and economic assessment. Driven by rapid developments in deep learning technologies, the convolutional neural network (CNN) has dominated the semantic segmentation task for many years. Convolutional neural networks adopt hierarchical feature representation, demonstrating strong local information extraction. However, the local property of the convolution layer limits the network from capturing global context that is crucial for precise segmentation. Recently, Transformer comprise a hot topic in the computer vision domain. Transformer demonstrates the great capability of global information modelling, boosting many vision tasks, such as image classification, object detection and especially semantic segmentation. In this paper, we propose an efficient hybrid Transformer (EHT) for real-time urban scene segmentation. The EHT adopts a hybrid structure with and CNN-based encoder and a transformer-based decoder, learning global-local context with lower computation. Extensive experiments demonstrate that our EHT has faster inference speed with competitive accuracy compared with state-of-the-art lightweight models. Specifically, the proposed EHT achieves a 66.9% mIoU on the UAVid test set and outperforms other benchmark networks significantly. The code will be available soon.
연구 동기 및 목표
- 세분화 해상도가 높은 도시 환경에서 CNN의 전역 맥락을 포착하는 데 한계가 있음을 해결하기 위해.
- 실시간 세분화 작업에서 순수 트랜스포머의 높은 계산 비용을 극복하기 위해.
- 도시 환경 이해를 위해 국소적 및 전역적 맥락을 효과적으로 융합할 수 있는 경량이면서도 정확한 모델을 설계하기 위해.
- 기존의 경량 모델들보다 훨씬 빠른 추론 속도를 확보하면서도 경쟁 가능한 세분화 정확도를 달성하기 위해.
제안 방법
- EHT는 계층적 국소적 특징을 추출하기 위해 CNN 기반 인코더를 사용하는 하이브리드 아키텍처를 채택한다.
- 장거리 의존성과 특징 맵 전역의 맥락을 모델링하기 위해 트랜스포머 기반 디코더를 사용한다.
- CNN 인코더와 트랜스포머 디코더의 특징를 통합하여 국소-전역 특징 융합을 달성한다.
- 도시 환경 세그먼테이션 데이터셋에서 표준 세그먼테이션 손실 함수를 사용해 엔드 투 엔드로 모델을 훈련시킨다.
- 트랜스포머 디코더에서의 중복 계산을 최소화함으로써 추론 효율성을 우선시하는 아키텍처 설계를 한다.
- 자원 제약이 있는 플랫폼에서의 실시간 배포를 최적화하기 위해 아키텍처를 조정한다.
실험 결과
연구 질문
- RQ1순수 CNN보다 하이브리드 CNN-Transformer 아키텍처가 도시 환경 세분화에서 더 나은 전역 맥락 모델링을 달성할 수 있는가?
- RQ2최신 경량 모델들과 비교했을 때 제안된 EHT는 계산 효율성과 세분화 정확도 사이에서 어떻게 균형을 이룹니까?
- RQ3트랜스포머 기반 디코더는 실시간 도시 세분화에서 얼마나 많은 mIoU 향상을 이끌 수 있으며, 동시에 빠른 추론 속도를 유지할 수 있는가?
- RQ4CNN 인코더에서 추출한 국소적 특징과 트랜스포머 디코더에서 제공하는 전역 맥락을 융합하면, 복잡한 도시 환경에서 더 견고한 세분화를 이룰 수 있는가?
주요 결과
- EHT는 UAVid 테스트 세트에서 66.9%의 평균 교차율(mIoU)을 달성하며, 다른 벤치마크 네트워크를 능가한다.
- 모델은 최신 경량 세분화 모델보다 훨씬 빠른 추론 속도를 보인다.
- 하이브리드 아키텍처는 국소적 세부 사항과 장거리 의존성을 효과적으로 포착하여 세분화 정확도를 향상시킨다.
- CNN-Transformer 조합은 계산 오버헤드를 감소시키면서도 경쟁 가능한 성능을 달성한다.
- 모델은 해상도가 높은 도시 환경 이미지에서 강력한 일반화 능력을 보인다.
- 제안된 방법은 UAVid 벤치마크에서 높은 정확도를 유지하면서도 추론 속도에서 새로운 SOTA를 수립한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.