Skip to main content
QUICK REVIEW

[논문 리뷰] OrientedFormer: An End-to-End Transformer-Based Oriented Object Detector in Remote Sensing Images

Jiaqi Zhao, Zeyu Ding|arXiv (Cornell University)|2024. 09. 29.
Remote-Sensing Image Classification인용 수 4
한 줄 요약

OrientedFormer은 원격 감지 영상에서 기울기 있는 물체 검출을 위한 엔드 투 엔드 트랜스포머 기반 검출기로, 각도 인코딩, 기하 관계 모델링, 특징 오차정렬 문제를 해결하기 위해 가우시안 위치 인코딩, 워샤프스키 자기어텐션, 기울기 있는 크로스어텐션을 도입한다. DIOR-R 및 DOTA-v1.0에서 각각 +1.16와 +1.21 AP50의 SOTA 성능을 달성하면서 학습 에포크 수를 3×에서 1×로 감소시킨다.

ABSTRACT

Oriented object detection in remote sensing images is a challenging task due to objects being distributed in multi-orientation. Recently, end-to-end transformer-based methods have achieved success by eliminating the need for post-processing operators compared to traditional CNN-based methods. However, directly extending transformers to oriented object detection presents three main issues: 1) objects rotate arbitrarily, necessitating the encoding of angles along with position and size; 2) the geometric relations of oriented objects are lacking in self-attention, due to the absence of interaction between content and positional queries; and 3) oriented objects cause misalignment, mainly between values and positional queries in cross-attention, making accurate classification and localization difficult. In this paper, we propose an end-to-end transformer-based oriented object detector, consisting of three dedicated modules to address these issues. First, Gaussian positional encoding is proposed to encode the angle, position, and size of oriented boxes using Gaussian distributions. Second, Wasserstein self-attention is proposed to introduce geometric relations and facilitate interaction between content and positional queries by utilizing Gaussian Wasserstein distance scores. Third, oriented cross-attention is proposed to align values and positional queries by rotating sampling points around the positional query according to their angles. Experiments on six datasets DIOR-R, a series of DOTA, HRSC2016 and ICDAR2015 show the effectiveness of our approach. Compared with previous end-to-end detectors, the OrientedFormer gains 1.16 and 1.21 AP$_{50}$ on DIOR-R and DOTA-v1.0 respectively, while reducing training epochs from 3$ imes$ to 1$ imes$. The codes are available at https://github.com/wokaikaixinxin/OrientedFormer.

연구 동기 및 목표

  • 다양한 방향, 密집 배치, 척도 변화로 인해 국소화 및 분류가 어려운 원격 감지 영상에서 임의의 기울기 있는 물체를 검출하는 데 도전하는 것.
  • 트랜스포머를 기울기 있는 물체 검출에 확장할 때의 세 가지 핵심 제약 사항을 극복하는 것: 각도 인코딩, 자기어텐션에서의 기하 관계 모델링 부족, 크로스어텐션에서의 오차정렬.
  • NMS와 같은 후처리를 제거하고 일대일 라벨 할당을 가능하게 하는 엔드 투 엔드 프레임워크를 설계하여 학습 효율성과 검출 정확도를 향상시키는 것.
  • CNN 기반 검출기와 경쟁 가능한 성능을 달성하면서도 학습 에포크 수를 3×에서 1×로 감소시켜 실용적 구현을 향상시키는 것.

제안 방법

  • 기울기 있는 바운딩 박스의 위치, 크기, 각도를 2차원 가우시안 분포를 사용해 동시에 표현하는 가우시안 위치 인코딩을 도입한다.
  • 워샤프스키 자기어텐션은 콘텐츠 쿼리 간의 기하 관계를 고려하여 가우시안 워샤프스키 거리 점수를 계산함으로써 콘텐츠 쿼리와 위치 쿼리 간의 상호작용을 가능하게 한다.
  • 기울기 있는 크로스어텐션은 객체 각도에 따라 위치 쿼리 중심도를 기준으로 샘플링 포인트를 회전시켜 값과 위치 쿼리를 정렬함으로써 특징 집합에서의 오차정렬을 감소시킨다.
  • 학습 가능한 쿼리를 갖춘 표준 트랜스포머 인코더-디코더 아키텍처를 사용하며, 위치 쿼리는 객체 중심을 나타내고 샘플링 포인트는 어텐션 계산을 위해 회전된다.
  • 이러한 구성 요소들을 통합하여 수동으로 설계된 후처리(예: NMS) 없이 통합된 엔드 투 엔드 프레임워크를 구현한다.
  • DIOR-R, DOTA-v1.0, DOTA-v1.5, HRSC2016, ICDAR2015 등 여섯 개의 데이터셋에서 실험을 수행하였으며, 아블레이션 스터디를 통해 각 구성 요소의 기여도를 검증하였다.
(a)
(a)

실험 결과

연구 질문

  • RQ1트랜스포머 기반 검출기가 원격 감지 영상에서 객체의 각도, 위치, 크기를 동시에 효과적으로 인코딩할 수 있는가?
  • RQ2자기어텐션 메커니즘 내에서 객체 쿼리 간의 기하 관계를 효과적으로 모델링할 수 있는가? 이는 검출 성능 향상에 기여하는가?
  • RQ3객체 방향에 따라 샘플링 포인트를 회전시킴으로써 크로스어텐션에서의 특징 오차정렬을 완화할 수 있는가?
  • RQ4제안된 엔드 투 엔드 프레임워크는 이전 검출기 대비 정확도와 학습 효율성 측면에서 뛰어난 성능을 보일 수 있는가?
  • RQ5다양한 조건(예: 낮은 조도, 극한 기상)을 가진 다양한 원격 감지 데이터셋에 대해 모델이 일반화 가능한가?

주요 결과

  • DIOR-R 데이터셋에서 기존 엔드 투 엔드 검출기 대비 1.16 AP50 향상으로 뛰어난 정확도를 입증하였다.
  • DOTA-v1.0에서 이전 엔드 투 엔드 방법 대비 AP50가 1.21 포인트 향상되어 강력한 일반화 능력을 확인하였다.
  • 성능을 유지하거나 향상시키면서도 학습 에포크 수를 3×에서 1×로 감소시켜 학습 효율성을 크게 향상시켰다.
  • 아블레이션 스터디를 통해 가우시안 위치 인코딩, 워샤프스키 자기어텐션, 기울기 있는 크로스어텐션 각각이 성능 향상에 기여하는 것으로 확인되었다.
  • 시각화 결과, 학습된 위치 쿼리가 객체 중심에 정확히 국소화되어 있고, 샘플링 포인트가 기울기 있는 박스와 효과적으로 정렬되는 것으로 나타나 메커니즘의 정확성을 확인하였다.
  • 작은 객체, 높은 종횡비, 저조도 조건과 같은 도전적인 케이스에서도 견고한 성능을 보였지만, 극도로 작은 객체나 배경과 유사한 객체에서는 일부 최적화되지 않은 결과가 존재한다.
(b)
(b)

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.