Skip to main content
QUICK REVIEW

[논문 리뷰] Transformer Meets Convolution: A Bilateral Awareness Network for Semantic Segmentation of Very Fine Resolution Urban Scene Images

Libo Wang, Rui Li|arXiv (Cornell University)|2021. 06. 23.
Automated Road and Building Extraction참고 문헌 55인용 수 9
한 줄 요약

이 논문은 매우 높은 해상도(VFR) 도시 환경 영상에서의 의미 분할 성능을 향상시키기 위해 트랜스포머 기반 장거리 종속성 모델링과 컨볼루션 기반 특징 추출을 융합하는 새로운 아키텍처인 이중 인식 네트워크(BANet)를 제안한다. ResT 기반 종속성 경로와 스택된 컨볼루션 텍스처 경로를 선형 어텐션 융합 모듈과 통합함으로써 BANet는 UAVid 데이터셋에서 64.6%의 mIoU를 달성하여 대규모 도시 분할 벤치마크에서 최신 기술 수준의 성능을 입증한다.

ABSTRACT

Semantic segmentation from very fine resolution (VFR) urban scene images plays a significant role in several application scenarios including autonomous driving, land cover classification, and urban planning, etc. However, the tremendous details contained in the VFR image, especially the considerable variations in scale and appearance of objects, severely limit the potential of the existing deep learning approaches. Addressing such issues represents a promising research field in the remote sensing community, which paves the way for scene-level landscape pattern analysis and decision making. In this paper, we propose a Bilateral Awareness Network which contains a dependency path and a texture path to fully capture the long-range relationships and fine-grained details in VFR images. Specifically, the dependency path is conducted based on the ResT, a novel Transformer backbone with memory-efficient multi-head self-attention, while the texture path is built on the stacked convolution operation. Besides, using the linear attention mechanism, a feature aggregation module is designed to effectively fuse the dependency features and texture features. Extensive experiments conducted on the three large-scale urban scene image segmentation datasets, i.e., ISPRS Vaihingen dataset, ISPRS Potsdam dataset, and UAVid dataset, demonstrate the effectiveness of our BANet. Specifically, a 64.6% mIoU is achieved on the UAVid dataset. Code is available at https://github.com/WangLibo1995/GeoSeg.

연구 동기 및 목표

  • 기존 딥 러닝 모델이 극한의 스케일 및 외관 변화로 인해 어려움을 겪는 매우 높은 해상도(VFR) 도시 환경 영상에서의 의미 분할 문제를 해결하기 위해.
  • 현재 모델들이 고해상도 위성 영상에서 장거리 맥락적 종속성과 세밀한 국소적 세부 정보를 동시에 포착하는 데에 한계를 보이는 문제를 극복하기 위해.
  • 트랜스포머와 컨볼루션 네트워크의 강점을 효과적으로 통합하여 도시 환경에서의 전체 장면 이해를 향상시키는 통합 네트워크 아키텍처를 설계하기 위해.
  • ISPRS Vaihingen, Potsdam, UAVid를 포함한 대규모 실세계 도시 분할 데이터셋에서 제안된 방법을 검증하기 위해.

제안 방법

  • 네트워크는 이중 경로 설계를 채택한다: 다중 헤드 자기어텐션을 갖춘 메모리 효율적인 트랜스포머 기반 백본인 ResT를 기반으로 한 종속성 경로를 통해 장거리 공간 종속성을 모델링한다.
  • 별도의 텍스처 경로는 스택된 컨볼루션 레이어를 사용하여 VFR 영상에서 세밀한 국소적 특징을 유지하고 추출한다.
  • 선형 어텐션 기반 특징 집합 모듈을 도입하여 종속성 경로와 텍스처 경로의 특징을 효과적으로 융합함으로써 계산 비용을 줄이고 성능를 유지한다.
  • 융합 메커니즘은 양 경로의 상호보완적 표현에 동적으로 어우러지며, 후속 분할 작업을 위한 특징 표현을 향상시킨다.
  • 표준 교차 엔트로피 손실 및 Dice 손실 목표 함수를 사용하여 세 개의 대규모 도시 분할 데이터셋에서 엔드 투 엔드로 모델을 훈련시킨다.
  • 공간 감소 및 특징 정제 모듈을 통해 고해상도 입력을 위해 최적화된 아키텍처로, 해상도와 세부 정보를 유지한다.

실험 결과

연구 질문

  • RQ1트랜스포머와 컨볼루션을 융합한 이중 경로 네트워크가 매우 높은 해상도 도시 환경 영상에서 의미 분할 정확도를 향상시킬 수 있는가?
  • RQ2ResT와 같은 메모리 효율적인 트랜스포머 백본이 고해상도 위성 데이터에서 장거리 종속성을 얼마나 효과적으로 포착할 수 있는가?
  • RQ3장거리 종속성 특징과 국소 텍스처 특징을 융합할 경우, 복잡한 도시 환경에서의 분할 성능 향상 정도는 어느 정도인가?
  • RQ4제안된 선형 어텐션 기반 융합 메커니즘이 특징 통합에서 표준 연결 또는 원소별 연산보다 우수한 성능을 내는가?

주요 결과

  • BANet는 UAVid 데이터셋에서 평균 교차율(mIoU) 64.6%를 달성하여 매우 높은 해상도 도시 영상의 의미 분할 분야에서 새로운 최신 기술 수준의 성능을 확립한다.
  • 모델은 ISPRS Vaihingen 및 Potsdam 데이터셋에서도 뛰어난 성능을 보이며, 다양한 도시 환경과 영상 해상도에 걸쳐 일반화 능력을 확인한다.
  • 제거 실험 결과, 종속성 경로(ResT)와 텍스처 경로(컨볼루션)가 최종 성능에 기여하는 바가 크며, 이중 경로 설계의 타당성을 검증한다.
  • 선형 어텐션 융합 모듈은 계산 복잡도를 낮추면서도 높은 특징 표현 품질을 유지하여 고해상도 입력에 적합한 효율성을 확보한다.
  • 트랜스포머와 컨볼루션의 통합은 도시 환경에서의 스케일 변화와 객체 외관 다양성에 더 잘 대응할 수 있도록 한다.
  • 모델는 다양한 도시 데이터셋 간에 잘 일반화되며, 원격 감시 영상에서의 도메인 이동에 대한 강건성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.