Skip to main content
QUICK REVIEW

[論文レビュー] THE Benchmark: Transferable Representation Learning for Monocular Height Estimation

Zhitong Xiong, Wei Huang|arXiv (Cornell University)|Dec 30, 2021
Video Surveillance and Tracking Methods被引用数 9
ひとこと要約

この論文は、合成データセット(GTAH)と実世界データセット(AHN)を含む大規模なクロスデータセットベンチマーク、THE Benchmarkを導入し、単眼高さ推定(MHE)における転移学習研究を可能にする。スウィン変換器フレームワーク内にスケール可変性を有する畳み込みモジュール(SDC)を提案し、特にGTAHで事前学習した場合、ImageNet やリモートセンシング自己教師付きモデルと比較して、少サンプルクロスデータセット転移設定で優れた性能を示す。

ABSTRACT

Generating 3D city models rapidly is crucial for many applications. Monocular height estimation is one of the most efficient and timely ways to obtain large-scale geometric information. However, existing works focus primarily on training and testing models using unbiased datasets, which does not align well with real-world applications. Therefore, we propose a new benchmark dataset to study the transferability of height estimation models in a cross-dataset setting. To this end, we first design and construct a large-scale benchmark dataset for cross-dataset transfer learning on the height estimation task. This benchmark dataset includes a newly proposed large-scale synthetic dataset, a newly collected real-world dataset, and four existing datasets from different cities. Next, a new experimental protocol, few-shot cross-dataset transfer, is designed. Furthermore, in this paper, we propose a scale-deformable convolution module to enhance the window-based Transformer for handling the scale-variation problem in the height estimation task. Experimental results have demonstrated the effectiveness of the proposed methods in the traditional and cross-dataset transfer settings. The datasets and codes are publicly available at https://mediatum.ub.tum.de/1662763 and https://thebenchmarkh.github.io/.

研究の動機と目的

  • 実世界の応用における単眼高さ推定(MHE)のための、大規模で多様性に富み、転送可能なデータセットの不足に対処すること。
  • 偏りのあるドメイン内訓練・テストを越えて、異なる都市や撮影条件間でのモデルの転送性を検討すること。
  • MHEにおける少サンプルクロスデータセット転移学習を支援するベンチマークデータセットを構築すること。
  • リモートセンシング画像における顕著なスケール変動とドメインシフト下でのモデル一般化性能の向上。
  • 合成データ(GTAH)の事前学習と自然画像(ImageNet)またはリモートセンシング自己教師付きデータの事前学習の有効性を評価すること。

提案手法

  • 著者らは、グランド・セフト・オート(GTA)ゲームから得た大規模な合成データセットGTAHを構築し、多様なカメラポーズ、解像度、視点角度下での高解像度RGB画像と真値高さ画像を含む。
  • オランダの複数都市をカバーするLiDDR由来の正確な高さラベルを備えた実世界データセットAHNを収集・公開した。
  • 1%のターゲットデータセット学習データのみを用いてモデル一般化性能を評価するため、少サンプルクロスデータセット転移を目的とした新しい実験プロトコルを設計した。
  • スケール変形性を有する畳み込み(SDC)モジュールを提案し、ウィンドウベースのスウィン変換器の性能を向上させ、高さ推定におけるスケール変動のより良い処理を可能にした。
  • モデルはGTAHで事前学習し、実世界データセットで少サンプルの微調整を実施。ImageNet、GTAH、リモートセンシング自己教師付きモデルでの事前学習を比較するアブレーションスタディを実施。
  • 重みと損失分布の可視化を用いて、特徴学習ダイナミクスとドメインシフト低減の分析を実施。

実験結果

リサーチクエスチョン

  • RQ1GTAHのような合成データセットは、多様な実世界都市間で単眼高さ推定の転送性能を効果的に向上させることができるか?
  • RQ2MHEにおける少サンプルクロスデータセット転移において、GTAHで事前学習する場合とImageNet やリモートセンシング自己教師付き事前学習と比較して、性能はどのように異なるか?
  • RQ3提案されたスケール可変性畳み込みモジュールは、高さ推定におけるスケール変動をどの程度軽減できるか?
  • RQ4ImageNet、GTAH、実世界データで事前学習したモデルの重みと損失分布はどのように異なるか?これはドメイン一般化に何を示唆するか?
  • RQ5少サンプルクロスデータセット転移プロトコルは、実世界の展開シナリオにおけるMHEモデルの一般化能力を効果的に評価できるか?

主な発見

  • GTAHで事前学習したモデルは、ImageNetで事前学習したモデルと比較して、収束が著しく速く、特にImageNetベースのモデルが収束に苦労するJAX や ATL などの困難なデータセットで優れた性能を示した。
  • GTAHで事前学習したSwinUper+SDCモデルは、すべての5つの実世界データセット(AHN, JAX, OMA, ATL, ARG)ですべてのベースラインを上回り、少サンプル設定下での強力な一般化性能を示した。
  • 重み分布の可視化により、GTAHで事前学習したモデルは、特に浅い層でImageNetで事前学習したモデルと比較して、実世界で学習したモデルの分布にはるかに近いことが明らかになった。
  • 微調整中の損失トレンドは、GTAHで事前学習したモデルがすべてのデータセットで収束を加速していることを示しており、JAX や ATL では顕著な優位性を示した。
  • GTAHで事前学習したモデルは、Sentinel-2データで自己教師付き学習(SSLTransformerRS)を実施したモデルと比較して優れた性能を示し、MHEにおける合成データの有効性を確認した。
  • スケール可変性畳み込みモジュールは、スケールが変動する高さ推定において性能を著しく向上させ、特に建物のスケールが多様な複雑な都市景観で有効であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。