Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Semantic Segmentation of Aerial Images Using Patch-based Attention

Lei Ding, Hao Tang|arXiv (Cornell University)|2019. 11. 20.
Advanced Neural Network Applications참고 문헌 29인용 수 11
한 줄 요약

이 논문은 영역 이미지의 의미적 분할을 위해 경량화된 국소 주의망(LANet)을 제안한다. 이는 국소 패치 기반 주의를 통해 맥락 표현을 향상시키는 패치 주의 모듈(PAM)과 고수준 특징에서 저수준 특징으로 의미적 집중을 전달하는 주의 임bedding 모듈(AEM)을 도입함으로써 이루어진다. LANet는 두 개의 항공 이미지 데이터셋에서 기준 FCN 및 최신 기술보다 뛰어난 분할 정확도를 달성하며, Potsdam에서 전체 정확도 89.83%와 Vaihingen에서 평균 F1 스코어 88.09%를 기록한다.

ABSTRACT

The trade-off between feature representation power and spatial localization accuracy is crucial for the dense classification/semantic segmentation of aerial images. High-level features extracted from the late layers of a neural network are rich in semantic information, yet have blurred spatial details; low-level features extracted from the early layers of a network contain more pixel-level information, but are isolated and noisy. It is therefore difficult to bridge the gap between high and low-level features due to their difference in terms of physical information content and spatial distribution. In this work, we contribute to solve this problem by enhancing the feature representation in two ways. On the one hand, a patch attention module (PAM) is proposed to enhance the embedding of context information based on a patch-wise calculation of local attention. On the other hand, an attention embedding module (AEM) is proposed to enrich the semantic information of low-level features by embedding local focus from high-level features. Both of the proposed modules are light-weight and can be applied to process the extracted features of convolutional neural networks (CNNs). Experiments show that, by integrating the proposed modules into the baseline Fully Convolutional Network (FCN), the resulting local attention network (LANet) greatly improves the performance over the baseline and outperforms other attention based methods on two aerial image datasets.

연구 동기 및 목표

  • 항공 이미지 의미적 분할에서 의미 표현 능력과 공간 정밀도 간의 상충 관계를 해결하기 위해.
  • 큰 규모의 항공 이미지에서 전반적인 시나리오 맥락이 모호한 상황에서 전역 수준의 주의 메커니즘이 가지는 한계를 극복하기 위해.
  • 국소적 패치 기반 주의와 다중 수준 간 주의 전달을 통해 고수준 및 저수준 특징의 표현을 향상시키기 위해.
  • 계산 비용을 증가시키지 않고도 특징 융합을 향상시키는 경량화되고 통합 가능한 모듈을 설계하기 위해.

제안 방법

  • 이미지 패치에서 국소 주의 서술자를 계산하여 고수준 및 저수준 특징의 맥락 인식 특징 표현을 향상시키는 패치 주의 모듈(PAM)을 제안한다.
  • 고수준 특징에서의 의미적 집중을 저수준 특징으로 전달하여, 공간 세부 정보를 유지하면서도 그 의미적 내용을 향상시키는 주의 임베딩 모듈(AEM)을 도입한다.
  • 완전 컨volution 네트워크(FCN) 기반 구조의 특징 추출 후에 PAM과 AEM을 플러그인 모듈로 적용하여 엔드 투 엔드 학습을 가능하게 한다.
  • PAM 내부에서 공간적 및 채널 기반 주의 메커니즘을 활용하여 국소 맥락을 집계함으로써 유사 의미 클래스 간 혼동을 감소시킨다.
  • AEM에서 학습 가능한 주의 가중치 메커니즘을 도입하여 고수준 의미적 신호에 기반해 저수준 특징을 동적으로 조절한다.
  • 두 모듈을 통합하여 유일한 네트워크 아키텍처인 국소 주의망(LANet)을 설계하여 특징 융합 및 분할 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1패치 기반 국소 주의는 항공 이미지 분할에서 고수준 특징의 맥락 표현을 향상시킬 수 있는가?
  • RQ2고수준에서 저수준 특징으로의 주의 기반 특징 향상은 의미적 내용과 공간 분포 간 격차를 줄일 수 있는가?
  • RQ3제한된 시나리오 수준의 구분이 있는 대규모 항공 이미지에서 경량화된 국소 주의 기반 메커니즘이 전역 주의 메커니즘을 능가할 수 있는가?
  • RQ4제안된 LANet는 의미적 분할 정확도와 경계 명확성 측면에서 최신 기술의 주의 기반 및 수용 영역 확장 모델과 비교해 어떻게 성능을 내는가?

주요 결과

  • LANet는 Potsdam 데이터셋에서 기준 FCN(88.66%) 및 모든 주의 기반 방법을 뛰어넘어 전체 정확도 89.83%를 달성한다.
  • Vaihingen 데이터셋에서 LANet는 DeepLabv3+ 및 PSPNet을 포함한 모든 비교 모델을 능가하여 평균 F1 스코어 88.09%를 기록한다.
  • 패치 주의 모듈(PAM)은 맥락 표현을 향상시켜 예측의 분할 조각화를 감소시키고 경계 명확성을 향상시킨다.
  • 주의 임베딩 모듈(AEM)은 저수준 특징의 의미적 품질을 크게 향상시켜 고수준 특징과의 융합을 개선한다.
  • SE 및 CBAM과 같은 전역 주의 메커니즘은 항공 이미지에서 전반적인 시나리오 맥락이 모호하기 때문에 성능이 열등한 반면, PAM의 국소 패치 기반 접근 방식은 이 문제를 완화한다.
  • 시각적 결과에서는 LANet가 FCN 및 기타 주의 기반 모델에 비해 더 정확하고 세밀한 분할 결과를 도출함을 확인할 수 있다. 특히 자동차나 보도와 같은 소형 객체에서 뚜렷한 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.