Skip to main content
QUICK REVIEW

[논문 리뷰] LEFormer: A Hybrid CNN-Transformer Architecture for Accurate Lake Extraction from Remote Sensing Imagery

Ben Chen, Xuechao Zou|arXiv (Cornell University)|2023. 08. 08.
Flood Risk Assessment and ManagementEnvironmental Science인용 수 3
한 줄 요약

LEFormer는 경량화된 하이브리드 CNN-Transformer 아키텍처를 제안하여 원격 감지 영상에서 정확한 호수 추출을 달성한다. CNN 인코더와 다중 척도 공간-채널 주의 모듈, 그리고 경량화된 Transformer 인코더와 교차 주의 병합을 결합하여 최신 기술 수준의 성능을 달성한다. Surface Water 데이터셋에서 90.86% mIoU, 청해-티베트 고원 호수 데이터셋에서 97.42% mIoU를 기록하며 뿐만 아니라 파rameter 수가 361만 개에 불과하여 이전 방법보다 정확도와 효율성 면에서 뛰어나며, 파rameter 수를 20배 감소시켰다.

ABSTRACT

Lake extraction from remote sensing images is challenging due to the complex lake shapes and inherent data noises. Existing methods suffer from blurred segmentation boundaries and poor foreground modeling. This paper proposes a hybrid CNN-Transformer architecture, called LEFormer, for accurate lake extraction. LEFormer contains three main modules: CNN encoder, Transformer encoder, and cross-encoder fusion. The CNN encoder effectively recovers local spatial information and improves fine-scale details. Simultaneously, the Transformer encoder captures long-range dependencies between sequences of any length, allowing them to obtain global features and context information. The cross-encoder fusion module integrates the local and global features to improve mask prediction. Experimental results show that LEFormer consistently achieves state-of-the-art performance and efficiency on the Surface Water and the Qinghai-Tibet Plateau Lake datasets. Specifically, LEFormer achieves 90.86% and 97.42% mIoU on two datasets with a parameter count of 3.61M, respectively, while being 20 minor than the previous best lake extraction method. The source code is available at https://github.com/BastianChen/LEFormer.

연구 동기 및 목표

  • 원격 감지 데이터의 복잡한 호수 형태와 노이즈로 인한 과제를 해결하기 위해.
  • 기존 CNN 및 Transformer 모델이 제한하는 경계 정확도 향상과 전경 모델링 향상을 위해.
  • 국소적 및 전역적 특징 추출을 결합한 경량화되고 효율적인 아키텍처를 설계하여 우수한 성능을 달성하기 위해.
  • 기준 호수 세그멘테이션 데이터셋에서 정확도와 계산 효율성 면에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 모델은 깊이 분리형 컨볼루션을 사용하는 CNN 인코더와 다중 척도 공간-채널 주의(MSCA) 모듈을 활용하여 국소적 공간 세부 정보와 다중 척도 특징 추출을 향상시킨다.
  • 패치 기반 처리 방식을 사용하는 경량화된 Transformer 인코더는 장거리 의존성과 전역적 맥락을 포착하면서도 계산 비용을 감소시킨다.
  • 교차 인코더 병합 모듈은 CNN 및 Transformer 인코더의 특징을 통합하여 최종 마스크 예측 성능을 향상시킨다.
  • MSCA 모듈은 확장형 컨볼루션과 CBAM을 결합하여 다중 척도 특징에 동적으로 주의를 기울이고 표현력을 향상시킨다.
  • 단계별 다운샘플링과 주의 메커니즘을 최적화하여 하이퍼파ram터를 정밀하게 조정함으로써 효율성과 정확도를 확보한다.
  • 표준 세그멘테이션 손실을 사용하여 Surface Water 및 청해-티베트 고원 호수 데이터셋에서 엔드 투 엔드로 모델을 훈련시킨다.

실험 결과

연구 질문

  • RQ1하이브리드 CNN-Transformer 아키텍처는 원격 감지 영상에서 호수 추출의 경계 정확도와 전경 모델링을 향상시킬 수 있는가?
  • RQ2국소적(CNN)과 전역적(Transformer) 특징 학습을 조합할 경우, 복잡한 호수 데이터셋에서의 세그멘테이션 성능에 어떤 영향을 미치는가?
  • RQ3호수 세그멘테이션 작업에서 모델 복잡도, 파ram터 수, 성능 간 최적의 균형은 무엇인가?
  • RQ4다중 척도 주의와 교차 인코더 병합은 특징 표현 및 세그멘테이션 정확도를 얼마나 향상시키는가?

주요 결과

  • LEFormer는 Surface Water 데이터셋에서 90.86% mIoU, 청해-티베트 고원 호수 데이터셋에서 97.42% mIoU를 기록하여 새로운 최신 기술 수준의 성능을 확립했다.
  • 모델은 단지 361만 개의 파ram터와 12.7억 개의 FLOPs만을 사용하여 이전 최고 성능 기록인 MSNANET 대비 크기는 20배 작고, FLOPs 기준으로는 48배 더 효율적이다.
  • 제거 실험 결과, CNN에 MSCA와 Transformer에 PTL(패치 기반 자기 주의)를 조합한 조합이 가장 높은 정확도를 기록했으며, MSCA는 SW에서 0.17% mIoU 향상, QTPL에서 0.20% 향상 기여했다.
  • 깊이 분리형 컨볼루션과 MSCA의 포함으로 mIoU가 각각 0.28%와 0.17% 향상되어 특징 학습에서의 효과를 입증했다.
  • CNN 인코더나 PTL을 제거할 경우 mIoU가 각각 0.38%와 0.07% 감소하여, 이들이 성능 향상에 핵심적인 역할을 한다는 점을 확인했다.
  • 모든 비교 모델, 즉 SegFormer, SegNeXt, MSNANET을 포함하여 두 데이터셋 모두에서 정확도와 효율성 면에서 LEFormer가 모두 슈퍼리어한 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.