Skip to main content
QUICK REVIEW

[논문 리뷰] PolyBuilding: Polygon Transformer for End-to-End Building Extraction

Yuan Hu, Zhibin Wang|arXiv (Cornell University)|2022. 11. 03.
Automated Road and Building Extraction인용 수 4
한 줄 요약

PolyBuilding는 변형 가능 트랜스포머 인코더-디코더 아키텍처를 사용하여 원격 감지 이미지에서 직접 벡터화된 건물 다각형을 예측하는 완전한 엔드 투 엔드 다각형 트랜스포머 모델이다. 이 모델은 다각형 좌표를 동시에 회귀하고 코너 정점의 클래스를 분류하며, 중복을 줄이기 위해 1차원 비최대 억제를 적용하여, CrowdAI 데이터셋에서 픽셀 수준의 커버리지, 인스턴스 수준의 정밀도/재현율, 기하학적 규칙성에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

We present PolyBuilding, a fully end-to-end polygon Transformer for building extraction. PolyBuilding direct predicts vector representation of buildings from remote sensing images. It builds upon an encoder-decoder transformer architecture and simultaneously outputs building bounding boxes and polygons. Given a set of polygon queries, the model learns the relations among them and encodes context information from the image to predict the final set of building polygons with fixed vertex numbers. Corner classification is performed to distinguish the building corners from the sampled points, which can be used to remove redundant vertices along the building walls during inference. A 1-d non-maximum suppression (NMS) is further applied to reduce vertex redundancy near the building corners. With the refinement operations, polygons with regular shapes and low complexity can be effectively obtained. Comprehensive experiments are conducted on the CrowdAI dataset. Quantitative and qualitative results show that our approach outperforms prior polygonal building extraction methods by a large margin. It also achieves a new state-of-the-art in terms of pixel-level coverage, instance-level precision and recall, and geometry-level properties (including contour regularity and polygon complexity).

연구 동기 및 목표

  • 복잡한 후처리 파이프라인을 피하기 위해 원격 감지 영상에서 직접 벡터화된 건물 다각형을 예측할 수 있는 완전한 엔드 투 엔드 방법을 개발한다.
  • 예측된 건물의 기하학적 품질을 향상시키기 위해 날카운 코너, 직선 모서리, 낮은 정점 중복을 보장한다.
  • 세그멘테이션 기반 방법(덩어리 모양)과 다단계 검출+회귀 방법(유연성 부족, 오류 발생 가능성 높음)의 한계를 해결한다.
  • 고정된 정점 수 샘플링과 학습 가능한 쿼리를 사용하여 다수의 건물 인스턴스 간에 입력과 출력 표현을 통합한다.
  • 트랜스포머의 자기주의 메커니즘을 활용하여 GPU에서 효율적이고 병렬 처리 가능한 학습 및 추론을 가능하게 한다.

제안 방법

  • 건물 다각형의 정점 좌표 시퀀스를 예측하기 위해 다각형 회귀 헤드를 도입한 변형 가능 DETR을 확장한다.
  • 각 예측 정점에 대해 신뢰도 점수를 출력하여 진짜 코너를 식별하는 코너 분류 헤드를 도입한다.
  • 모든 인스턴스에 동일한 수의 정점로 지도 데이터의 다각형을 표준화하기 위해 균일한 샘플링 인코딩 기법을 사용한다.
  • 위치 학습과 코너 분류를 분리하여 수렴을 향상시키기 위해 이중 단계 학습 전략을 적용한다.
  • 코너 점수에 대해 1차원 비최대 억제를 적용하여 중복 정점을 제거하고 다각형 기하학을 정밀하게 조정한다.
  • 매칭 프oxy로 바운딩 박스를 사용하여 지도 데이터와 예측 인스턴스 간의 이항 매칭을 수행한다.

실험 결과

연구 질문

  • RQ1완전한 엔드 투 엔드 트랜스포머 기반 모델이 원격 감지 영상에서 정확하고 규칙적이며 복잡도가 낮은 건물 다각형을 직접 예측할 수 있는가?
  • RQ2다각형 좌표의 동시 회귀와 코너 분류가 세그멘테이션 기반 또는 다단계 방법에 비해 기하학적 정밀도를 어떻게 향상시키는가?
  • RQ31차원 비최대 억제가 코너 근처의 정점 중복을 어느 정도 줄일 수 있으며, 동시에 코너 정확도를 유지할 수 있는가?
  • RQ4고정된 정점 수 균일 샘플링과 학습 가능한 쿼리를 사용함으로써 다양한 건물 형태와 크기 간에 효과적인 일반화가 가능한가?
  • RQ5후처리 파이프라인에 의존하지 않고도 인스턴스 수준의 검출 성능과 기하학 수준의 규칙성에서 뛰어난 성능을 달성할 수 있는가?

주요 결과

  • PolyBuilding는 픽셀 수준 커버리지, 인스턴스 수준 정밀도 및 재현율, 윤곽 규칙성 및 다각형 복잡도와 같은 기하학 수준 성질에서 CrowdAI 데이터셋에서 새로운 최신 기술 수준의 성능을 달성한다.
  • 모델은 정량적 지표와 정성적 시각적 품질 양면에서 이전의 세그멘테이션 기반 및 다단계 다각형 추출 방법보다 뚜렷이 뛰어난 성능을 보였다.
  • 다각형 회귀와 코너 분류의 조합은 날카운 코너와 최소한의 정점 중복을 가진 다각형 생성을 가능하게 한다.
  • 1차원 비최대 억제는 형태 정확도를 떨어뜨리지 않으면서도 코너 근처의 중복 정점을 효과적으로 줄였다.
  • 실패 사례는 주로 정점 국소화 오류 또는 짧은 모서리에서 NMS 필터링 오류에서 기인하며, 기하학적 정규화 손실을 통해 향상 가능할 여지가 있음을 시사한다.
  • 모델는 강력한 일반화 및 내성성을 보였으며, 명시적인 교차 방지 제약 조건 없이도 예측에서 다각형 교차가 관측되지 않았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.