[논문 리뷰] THE Benchmark: Transferable Representation Learning for Monocular Height Estimation
이 논문은 대규모 다중 데이터셋 기반 단일 뷰 높이 추정(MHE)을 위한 THE Benchmark를 소개한다. 이는 합성 데이터셋(GTAH)과 실세계 데이터셋(AHN)으로 구성되며, 전이 학습 연구를 가능하게 한다. Swin Transformer 프레임워크 내에 스케일 변형 가능 컨볼루션 모듈을 제안하여, 특히 GTAH에서 미리 훈련된 모델이 ImageNet 또는 원격 감시 자기지도 학습 모델보다 우수한 성능을 보이며 소수의 샘플로도 전이 학습 성능이 뛰어나다.
Generating 3D city models rapidly is crucial for many applications. Monocular height estimation is one of the most efficient and timely ways to obtain large-scale geometric information. However, existing works focus primarily on training and testing models using unbiased datasets, which does not align well with real-world applications. Therefore, we propose a new benchmark dataset to study the transferability of height estimation models in a cross-dataset setting. To this end, we first design and construct a large-scale benchmark dataset for cross-dataset transfer learning on the height estimation task. This benchmark dataset includes a newly proposed large-scale synthetic dataset, a newly collected real-world dataset, and four existing datasets from different cities. Next, a new experimental protocol, few-shot cross-dataset transfer, is designed. Furthermore, in this paper, we propose a scale-deformable convolution module to enhance the window-based Transformer for handling the scale-variation problem in the height estimation task. Experimental results have demonstrated the effectiveness of the proposed methods in the traditional and cross-dataset transfer settings. The datasets and codes are publicly available at https://mediatum.ub.tum.de/1662763 and https://thebenchmarkh.github.io/.
연구 동기 및 목표
- 실세계 응용 분야에서 단일 뷰 높이 추정(MHE)을 위한 대규모, 다양한, 전이 가능한 데이터셋의 부족을 해결하기 위해.
- 편향된 도메인 내 훈련 및 테스트를 넘어, 다양한 도시와 영상 조건 간의 모델 전이 가능성에 대해 연구하기 위해.
- MHE를 위한 소수의 샘플로도 다중 데이터셋 전이 학습을 지원하는 벤치마크 데이터셋을 구축하기 위해.
- 원격 감시 영상에서 심각한 스케일 변화와 도메인 이동이 발생할 경우의 모델 일반화 능력을 향상시키기 위해.
- 합성 데이터(GTAH) 미리 훈련과 자연 이미지(ImageNet) 또는 원격 감시 자기지도 학습 데이터에서의 미리 훈련 효과를 평가하기 위해.
제안 방법
- 저자들은 대규모 합성 데이터셋인 GTAH를 구축하였으며, 이는 그랜드 테프트 아웃 간판 게임에서 유래한 것으로, 다양한 카메라 자세, 해상도, 시야 각도에서 고해상도 RGB 및 정답 높이 이미지를 포함한다.
- 저자들은 네덜란드 전역에서 수집한 AHN을 확보하고 공개하였으며, 이는 정밀한 LiDDR 기반 높이 레이블을 갖춘 실세계 데이터셋이다.
- 모델 일반화 능력을 평가하기 위해, 타겟 데이터셋의 훈련 데이터 중 1%만을 사용하는 소수의 샘플을 활용한 다중 데이터셋 전이 학습을 위한 새로운 실험 프로토콜을 설계하였다.
- 높이 추정에서의 스케일 변화를 더 잘 다룰 수 있도록 윈도우 기반 Swin Transformer에 스케일 변형 가능 컨볼루션(SDC) 모듈을 제안하였다.
- 모델은 GTAH에서 미리 훈련하고, 실세계 데이터셋에서 소수의 샘플로 파인튜닝 하였으며, ImageNet, GTAH, 원격 감시 자기지도 학습 모델에서의 미리 훈련 방식을 비교하기 위한 분석 실험을 수행하였다.
- 가중치 및 손실 분포 시각화를 통해 특징 학습 역학과 도메인 이동 완화 효과를 분석하였다.
실험 결과
연구 질문
- RQ1GTAH와 같은 합성 데이터셋이 다양한 실세계 도시에서 단일 뷰 높이 추정의 전이 성능을 효과적으로 향상시킬 수 있는가?
- RQ2GTAH에서의 미리 훈련이 ImageNet 또는 원격 감시 자기지도 학습 미리 훈련과 비교해 소수의 샘플로도 다중 데이터셋 전이 학습에서 어떤 성능 향상을 보이는가?
- RQ3제안된 스케일 변형 가능 컨볼루션 모듈이 높이 추정에서의 스케일 변화를 어느 정도 완화하는가?
- RQ4ImageNet, GTAH, 실세계 데이터에서 미리 훈련한 모델 간의 가중치 및 손실 분포는 어떻게 다름가? 이는 도메인 일반화에 어떤 함의를 갖는가?
- RQ5소수의 샘플로도 다중 데이터셋 전이 학습 프로토콜이 실세계 배포 환경에서 MHE 모델의 일반화 능력을 효과적으로 평가할 수 있는가?
주요 결과
- GTAH에서 미리 훈련한 모델은 ImageNet에서 미리 훈련한 모델보다 수렴 속도가 빠르고 성능이 뛰어나며, 특히 ImageNet 기반 모델이 수렴에 어려움을 겪는 도전적인 데이터셋인 JAX와 ATL에서 두드러진 성능 향상을 보였다.
- GTAH에서 미리 훈련한 SwinUper+SDC 모델은 AHN, JAX, OMA, ATL, ARG의 다섯 개의 실세계 데이터셋에서 모든 베이스라인을 능가하며, 소수의 샘플로도 강력한 일반화 성능을 보였다.
- 가중치 분포 시각화 결과, GTAH에서 미리 훈련한 모델은 ImageNet에서 미리 훈련한 모델보다 실세계 데이터에서 훈련한 모델과 훨씬 유사한 분포를 보였으며, 특히 얕은 층에서 두드러졌다.
- 파인튜닝 중 손실 추세 분석 결과, GTAH에서 미리 훈련한 모델은 모든 데이터셋에서 수렴 속도가 빨라졌으며, JAX와 ATL에서는 극명한 우위를 보였다.
- GTAH에서의 미리 훈련은 Sentinel-2 데이터에서 자기지도 학습한 모델(SSLTransformerRS)보다 뛰어난 성능을 보였으며, 이는 합성 데이터가 MHE에 효과적임을 확인한다.
- 스케일 변형 가능 컨볼루션 모듈은 스케일 변화가 심한 높이 추정에서 성능 향상을 효과적으로 개선하였으며, 특히 다양한 건물 크기를 포함한 복잡한 도시 환경에서 뚜렷한 효과를 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.