Skip to main content
QUICK REVIEW

[論文レビュー] A Semantic Segmentation Network for Urban-Scale Building Footprint Extraction Using RGB Satellite Imagery

Aatif Jiwani, Shubhrakanti Ganguly|arXiv (Cornell University)|Apr 2, 2021
Automated Road and Building Extraction被引用数 15
ひとこと要約

本論文では、都市スケールのRGBのみの建物ポリゴン抽出を高精度で行うために、拡張されたRes-Netをバックボーンとする変更版DeepLabV3+ネットワークを提案する。クラス不均衡に対処するためF-Beta損失を統合し、隣接する建物の分離を向上させるために指数的重み付け境界損失を導入することで、スケール、解像度、都市密度の変動に対して優れた視覚的品質と頑健性を示し、3つのベンチマークで最先端の性能を達成した。

ABSTRACT

Urban areas consume over two-thirds of the world's energy and account for more than 70 percent of global CO2 emissions. As stated in IPCC's Global Warming of 1.5C report, achieving carbon neutrality by 2050 requires a clear understanding of urban geometry. High-quality building footprint generation from satellite images can accelerate this predictive process and empower municipal decision-making at scale. However, previous Deep Learning-based approaches face consequential issues such as scale invariance and defective footprints, partly due to ever-present class-wise imbalance. Additionally, most approaches require supplemental data such as point cloud data, building height information, and multi-band imagery - which has limited availability and are tedious to produce. In this paper, we propose a modified DeeplabV3+ module with a Dilated Res-Net backbone to generate masks of building footprints from three-channel RGB satellite imagery only. Furthermore, we introduce an F-Beta measure in our objective function to help the model account for skewed class distributions and prevent false-positive footprints. In addition to F-Beta, we incorporate an exponentially weighted boundary loss and use a cross-dataset training strategy to further increase the quality of predictions. As a result, we achieve state-of-the-art performances across three public benchmarks and demonstrate that our RGB-only method produces higher quality visual results and is agnostic to the scale, resolution, and urban density of satellite imagery.

研究の動機と目的

  • LiDAR やマルチバンド画像などの補助データを必要とせずに、RGB衛星画像から正確な建物ポリゴンを抽出するディーブラーニングモデルの開発。
  • 建物セグメンテーションにおけるクラス不均衡、特に偽陽性や連結されたポリゴン予測の多発を是正すること。
  • 新規の損失関数設計により、密集した都市部における隣接建物の分離を向上させること。
  • スケール、解像度、都市密度の変動にかかわらず、公開ベンチマークで最先端の性能を達成するとともに、頑健性を維持すること。
  • 希少または高価なデータソースに依存を減らすことで、グローバルに適用可能な都市計画およびエネルギーモデリングを可能にすること。

提案手法

  • 3チャンネルのRGB衛星画像を処理するセグメンテーションバックボーンとして、拡張されたRes-Netをバックボーンとする変更版DeepLabV3+アーキテクチャを採用。
  • クラス不均衡の影響を軽減するため、目的関数にF-Beta損失関数を統合し、再現率よりも適合率を優先する。
  • 建物の境界における誤分類をペナルティ化するため、指数的重み付け境界損失(EWC)を導入し、隣接構造物の分離を向上。
  • 一般化性能を向上させるために、クロスデータセット学習を採用。
  • F-Beta損失とEWC損失の併用により、適合率と再現率のより良いトレードオフが実現され、偽陽性と連結予測が低減。
  • エンドツーエンドでフル解像度の衛星画像に対してモデル推論を実行し、建物ポリゴンのピクセル単位のセグメンテーションマスクを生成。

実験結果

リサーチクエスチョン

  • RQ1LiDAR や高さデータ、マルチスペクトル入力が不要な状況でも、RGB衛星画像のみを用いてディーブラーニングモデルが最先端の建物ポリゴンセグメンテーション性能を達成できるか。
  • RQ2F-Beta損失関数は、特に偽陽性予測の低減に寄与するのか、重度のクラス不均衡下でのセグメンテーション性能にどのように寄与するか。
  • RQ3指数的重み付け境界損失は、密集した都市部における隣接建物の分離にどの程度寄与するか。
  • RQ4クロスデータセット学習は、多様な都市環境および画像解像度におけるモデルの一般化性能を向上させるか。
  • RQ5提案手法は、複数のベンチマークで連結予測やスパarsな偽陽性予測を低減しながらも、高い適合率とmIOUを維持できるか。

主な発見

  • 提案手法は、SpaceNet、Urban3D、AICrowdの3つの公開ベンチマークで最先端の性能を達成し、mIOUとF-1スコアが向上した。
  • F-Beta損失におけるβ = 0.1が最高のF-1スコアとmIOUを達成し、建物ポリゴンセグメンテーションにおいて適合率が再現率よりも重要であることを示した。
  • F-Beta損失と指数的重み付け境界損失(EWC)の併用により、ベースライン損失と比較して、連結予測および偽陽性予測が顕著に低減した。
  • クロスデータセット学習は、Urban3DおよびSpaceNetでの性能向上をもたらしたが、AICrowdでは限定的な向上にとどまり、データセット固有のばらつきが転送性に影響している可能性を示唆した。
  • 視覚的結果から、最終モデルは、特に高密度地域において、より明確で滑らかなポリゴンを生成し、隣接建物の分離が良好であることが確認された。
  • 本モデルは、スケール、解像度、都市密度の変動にかかわらず優れた一般化性能を示し、実世界の都市応用における頑健性と実用性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。