Skip to main content
QUICK REVIEW

[論文レビュー] Multi-patch Feature Pyramid Network for Weakly Supervised Object Detection in Optical Remote Sensing Images

Pourya Shamsolmoali, Jocelyn Chanussot|arXiv (Cornell University)|Aug 18, 2021
Remote-Sensing Image Classification参考文献 58被引用数 44
ひとこと要約

本稿では、光学的リモートセンシング画像における弱教師付きオブジェクト検出のためのマルチパッチ特徴ファイターピラミッドネットワーク(MPFP-Net)を提案する。不完全なオブジェクトインスタンスや非凸な損失関数のランドスケープに対処するためにマルチパッチ学習を導入するとともに、ノルム保存型のクロススケール特徴融合を用いてマルチスケール検出性能を向上させる。モデルは5120万パラメータおよび2280億FLOPsを有し、LEVIRデータセットで86.73%のSOTA mAPを達成し、精度と効率の両面で既存手法を上回る性能を示した。

ABSTRACT

Object detection is a challenging task in remote sensing because objects only occupy a few pixels in the images, and the models are required to simultaneously learn object locations and detection. Even though the established approaches well perform for the objects of regular sizes, they achieve weak performance when analyzing small ones or getting stuck in the local minima (e.g. false object parts). Two possible issues stand in their way. First, the existing methods struggle to perform stably on the detection of small objects because of the complicated background. Second, most of the standard methods used hand-crafted features, and do not work well on the detection of objects parts of which are missing. We here address the above issues and propose a new architecture with a multiple patch feature pyramid network (MPFP-Net). Different from the current models that during training only pursue the most discriminative patches, in MPFPNet the patches are divided into class-affiliated subsets, in which the patches are related and based on the primary loss function, a sequence of smooth loss functions are determined for the subsets to improve the model for collecting small object parts. To enhance the feature representation for patch selection, we introduce an effective method to regularize the residual values and make the fusion transition layers strictly norm-preserving. The network contains bottom-up and crosswise connections to fuse the features of different scales to achieve better accuracy, compared to several state-of-the-art object detection models. Also, the developed architecture is more efficient than the baselines.

研究の動機と目的

  • 限られた監視情報と複雑な背景の影響を受ける光学的リモートセンシング画像において、小規模または部分的に可視なオブジェクトを検出する課題に対処すること。
  • 弱教師付き学習における損失関数の非凸性が原因で生じる誤ったオブジェクト部分検出や不完全なインスタンス学習を克服すること。
  • ノルム保存型のクロススケール接続を用いて、異なるレベルの特徴を統合することで、マルチスケールオブジェクト検出のための特徴表現を向上させること。
  • SOTAモデルと比較してモデルサイズとFLOPsを削減しながらも高い精度を維持できるスケーラブルで効率的なアーキテクチャを開発すること。
  • パッチ単位とスケール単位の学習戦略を統合することで、多様な画像ソースや条件下でも頑健な検出を可能にすること。

提案手法

  • 完全インスタンスアノテーションが得られない状況下でも、オブジェクトの共起的で特徴的な部分を学習できるように、画像パッチをクラス関連のサブセットに分割する複数パッチ学習(MPL)スキームを提案する。
  • 下流とクロスワイズの接続を用いた新規な特徴統合メカニズムを導入し、スケール間の特徴を統合する。特に、勾配の流れを安定化させるために、厳密にノルム保存型の統合層を採用する。
  • 計算コストの高いソフトマックス統合を置き換えるために、重み付きインスタント統合戦略を採用し、トレーニングコストを1.24倍削減しながらも性能を維持する。
  • 画像サイズ、深さ、幅の3次元を同時にスケーリングする、多方向性でスケールワイドな特徴ファイターピラミッドネットワーク(ESS-FPN)を組み込むことで、全次元にわたる特徴表現を強化する。
  • パッチ選択、特徴集約、セマンティックプロジェクションを統合的に扱える統一フレームワークを実現するため、統合損失関数を用いてネットワーク全体をエンドツーエンドで訓練する。
  • より豊富なマルチレベル特徴を抽出できるように、バックボーンとしてSPN(セマンティックピラミッドネットワーク)を採用し、精度と推論速度の両方を向上させる。

実験結果

リサーチクエスチョン

  • RQ1完全インスタンスアノテーションが得られない状況下でも、共起的オブジェクト部分をモデル化することで、マルチパッチ学習が弱教師付きオブジェクト検出を向上させ得るか?
  • RQ2クロススケールでノルム保存型の特徴統合は、リモートセンシング画像における小規模およびマルチスケールオブジェクトの検出性能をどのように向上させるか?
  • RQ3画像サイズ、深さ、幅を同時にスケーリングする統合的スケーリングは、単一次元スケーリングと比較して、特徴表現と検出精度にどの程度の向上効果をもたらすか?
  • RQ4提案されたインスタント統合メカニズムは、ソフトマックスまたはダイナミック統合と比較して、性能を劣化させることなく計算コストを削減できるか?
  • RQ5ベンチマークリモートセンシングデータセット上で、MPFP-NetはSOTAモデルと比較して精度と効率の両面で優れているか?

主な発見

  • MPFP-NetはLEVIRテストセットで86.73%の平均平均精度(mAP)を達成し、ベースラインのMPFP-Net-S6+FPNを8.32 mAP上回り、パラメータ数を58%削減した。
  • P40 GPU上では、次の速いベースラインと比較して3.7倍高速であり、他の検出器と比較して推論遅延を最大3.8倍まで短縮した。
  • 提案されたインスタント統合手法は、ソフトマックス統合と比較して1.24倍高速に動作し、同等のmAPとトレーニング安定性を維持した。計算コストを削減しながら性能に劣化を来さなかった。
  • パッチ単位とスケール単位の統合的学習は、検出の効率性と精度を向上させ、MPFP-Netはパッチ学習のみまたは単一次元スケーリングのみを用いたモデルを上回った。
  • DOTAデータセットでは、15のオブジェクトクラスすべてでSOTA性能を達成し、ごみごみとした背景でも正確で安定したボクセルボックス予測を実現した。
  • 大規模リモートセンシング画像における定性的な結果から、MPFP-Netは異なる画像ソースや条件下でも良好に一般化でき、小規模および不完全なオブジェクトの検出が頑健であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。