Skip to main content
QUICK REVIEW

[論文レビュー] Foreground-Aware Relation Network for Geospatial Object Segmentation in High Spatial Resolution Remote Sensing Imagery

Zhuo Zheng, Yanfei Zhong|arXiv (Cornell University)|Nov 19, 2020
Advanced Image and Video Retrieval Techniques参考文献 47被引用数 6
ひとこと要約

本稿では、高空間分解能リモートセンシング画像における地理的オブジェクトセグメンテーションのための前景認識関係ネットワークFarSegを提案する。前景シーン関係モジュールを統合することで前景特徴の識別性を向上させるとともに、トレーニング損失のバランスを取るための前景認識最適化を導入し、誤検出を低減し、前景・背景クラスの不均衡を緩和する。iSAID検証セットにおいて63.71%のmIoUを達成し、最先端の性能を実現した。

ABSTRACT

Geospatial object segmentation, as a particular semantic segmentation task, always faces with larger-scale variation, larger intra-class variance of background, and foreground-background imbalance in the high spatial resolution (HSR) remote sensing imagery. However, general semantic segmentation methods mainly focus on scale variation in the natural scene, with inadequate consideration of the other two problems that usually happen in the large area earth observation scene. In this paper, we argue that the problems lie on the lack of foreground modeling and propose a foreground-aware relation network (FarSeg) from the perspectives of relation-based and optimization-based foreground modeling, to alleviate the above two problems. From perspective of relation, FarSeg enhances the discrimination of foreground features via foreground-correlated contexts associated by learning foreground-scene relation. Meanwhile, from perspective of optimization, a foreground-aware optimization is proposed to focus on foreground examples and hard examples of background during training for a balanced optimization. The experimental results obtained using a large scale dataset suggest that the proposed method is superior to the state-of-the-art general semantic segmentation methods and achieves a better trade-off between speed and accuracy. Code has been made available at: \url{https://github.com/Z-Zheng/FarSeg}.

研究の動機と目的

  • 高空間分解能(HSR)リモートセンシング画像における大規模な変動、高いクラス内背景ばらつき、および前景・背景クラスの不均衡という課題に対処すること。
  • 大規模な地球観測シーンにおいて前景オブジェクトを明示的にモデリングできない一般化されたセマンティックセグメンテーション手法の限界を克服すること。
  • 地理的情報シーンにおける複雑で多様な背景が原因で生じる誤検出を低減すること。
  • 前景と背景の例の間の最適化プロセスのバランスを取ることで、トレーニング効率とモデルの頑健性を向上させること。
  • 地理的オブジェクトセグメンテーションタスクにおいて、速度と精度のより良いトレードオフを達成すること。

提案手法

  • シーン表現と専用の前景ブランチを備えた共有バックボーンを用いた、特徴ピラミッドネットワーク(FPN)に基づくマルチブランチエンコーダーを設計し、マルチスケール特徴を抽出する。
  • 地理的情報シーンと前景オブジェクトの間の相乗的関係を学習するための前景シーン関係(F-S)モジュールを導入し、文脈連関によって前景特徴の識別性を向上させる。
  • 容易な背景例の重みを動的に低減させ、難易度の高い例に注目することで、損失寄与のバランスを取る前景認識最適化戦略を実装する。
  • 合計を変更せずに損失分布を安定化させる正規化技術を適用し、トレーニング中の勾配消失を防止する。
  • 初期トレーニング段階での誤った難易度の高い例の推定による不安定性を軽減するため、動的重み付け段階でコサイン、線形、または多項式関数をアニーリング関数として適用する。
  • ファーカス損失における焦点要因γを調整し、難易度の高い例の重みを制御する。γ = 2が最適な性能を示した。

実験結果

リサーチクエスチョン

  • RQ1明示的な前景モデリングは、HSRリモートセンシング画像の地理的オブジェクトセグメンテーションにおける誤検出を低減できるか?
  • RQ2前景シーン関係学習は、複雑な背景において前景特徴の識別性をどのように向上させるか?
  • RQ3前景認識最適化は、トレーニング段階で前景・背景クラスの不均衡をどの程度緩和できるか?
  • RQ4安定的かつ効果的なトレーニングを実現するための焦点要因γとアニーリング関数の最適な設定は何か?
  • RQ5提案手法は、最先端の一般セマンティックセグメンテーションモデルと比較して、速度と精度のより良いバランスを達成できるか?

主な発見

  • 前景シーン関係モジュールは、前景関連の文脈を関連付けることで特徴の識別性を向上させ、港や空港のような複雑なシーンにおける誤検出を低減した。
  • 前景認識最適化は、ベースラインモデルおよびF-S関係強化モデルにそれぞれ2.2%および3.24%のmIoU向上をもたらしたが、追加の計算コストは発生しなかった。
  • 損失分布の正規化はトレーニングの安定性を顕著に向上させ、ナイーブなソフトマックスファーカス損失と比較してmIoUを2.49%向上させた。
  • コサインアニーリング関数は線形および多項式バージョンを上回り、損失重み付けの安定的で徐徐な調整を可能にし、0.63%のmIoU向上を達成した。
  • 焦点要因γ = 2が最適であり、iSAID検証セットで最高のmIoU 63.71%を達成した。一方、γ = 5ではノイズラベルが誤って難易度の高い例とみなされ、性能が低下した。
  • FarSegは、大規模なHSRリモートセンシングデータセット上で検証された結果、速度と精度の優れたトレードオフを実現し、最先端の性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。