Skip to main content
QUICK REVIEW

[論文レビュー] Ship Instance Segmentation From Remote Sensing Images Using Sequence Local Context Module

Yingchao Feng, Wenhui Diao|arXiv (Cornell University)|Apr 22, 2019
Advanced Neural Network Applications参考文献 7被引用数 4
ひとこと要約

本稿では、スタックドドレイトド畳み込みを用いてマルチスケールのコンテキスト学習を強化するSequence Local Context (SLC)モジュールを導入した、リモートセンシング画像向けの新しいインスタンスセグメンテーションフレームワーク、SLCMASK-Netを提案する。SLCモジュールにより、マスクレベルのAPがMask R-CNN比で10.98%向上し、高解像度のQuickBirdデータセットで78.61%のAPを達成し、密度の高い船の群れによる混同を効果的に低減した。

ABSTRACT

The performance of object instance segmentation in remote sensing images has been greatly improved through the introduction of many landmark frameworks based on convolutional neural network. However, the object densely issue still affects the accuracy of such segmentation frameworks. Objects of the same class are easily confused, which is most likely due to the close docking between objects. We think context information is critical to address this issue. So, we propose a novel framework called SLCMASK-Net, in which a sequence local context module (SLC) is introduced to avoid confusion between objects of the same class. The SLC module applies a sequence of dilation convolution blocks to progressively learn multi-scale context information in the mask branch. Besides, we try to add SLC module to different locations in our framework and experiment with the effect of different parameter settings. Comparative experiments are conducted on remote sensing images acquired by QuickBird with a resolution of $0.5m-1m$ and the results show that the proposed method achieves state-of-the-art performance.

研究の動機と目的

  • リモートセンシング画像における密に密集した船のインスタンスセグメンテーションにおいて、物体の混同を解消すること。
  • マスクブランチにおけるコンテキストに敏感な特徴学習を強化することで、マスクレベルのパフォーマンスを向上させること。
  • 計算負荷を増加させることなく、マルチスケールの空間的コンテキストを捉える軽量で効果的なコンテキストモジュールを設計すること。
  • モジュールの配置、ドレイト率、アーキテクチャ設定がセグメンテーション精度に与える影響を評価すること。

提案手法

  • バックボーンとしてResNet-101とFPNを用いたMask R-CNNに基づくフレームワークを採用し、空間的精度を保持するためRoIAlignを適用する。
  • マスクブランチに、増加するドレイト率(1, r₁, r₂)を有する3つのスタックドドレイトドコンボリューションブロックから構成される、新規のSequence Local Context (SLC)モジュールを導入する。
  • 各ブロックは1×1畳み込みと3×3ドレイトドコンボリューションを適用し、出力を要素ごとの和で統合することでマルチスケールコンテキストを蓄積する。
  • SLCモジュールは、大きなドレイト率による情報損失を避ける一方で、段階的に異なるスケールのコンテキストを学習できるように設計されている。
  • ネットワーク内の異なる位置(分類・回帰ブランチ含む)にモジュールを配置した評価を実施し、ドレイト率と層数に関する消去実験も実施した。
  • 公平な比較を確保するため、データオーグメンテーションと最適化されたアンカーセット設定を用いた実験を実施した。

実験結果

リサーチクエスチョン

  • RQ1マルチスケールコンテキスト学習は、リモートセンシングインスタンスセグメンテーションにおける密な船の群れの混同を軽減できるか?
  • RQ2標準的なASPPやインセプションモジュールと比較して、ドレイトドコンボリューションを段階的に適用する方式は、空間的コンテキストをより効果的に捉えられるか?
  • RQ3マスクAPを最大化するためのSLCモジュールの最適な配置と構成は何か?
  • RQ4コンテキスト強化は、ボックス検出性能よりもマスクレベルAPに顕著な効果をもたらすか?

主な発見

  • 提案されたSLCMASK-Netは、マスクレベルAPが78.61%に達し、ベースラインのMask R-CNN(67.63%)比で10.98%の向上を達成した。
  • SLCモジュールは他のコンテキストモジュールを上回る性能を示し、リコール85.68%、AP78.61%を達成。ASPP(2,4,6)(73.48% AP)やCCL(73.36% AP)を上回った。
  • SLCモジュールをマスクブランチに配置した場合が最良のパフォーマンスを示したが、分類・回帰ブランチに追加すると精度が低下した。
  • ドレイト率を2と3に設定した場合が最適であり、より高い率(例:4と6)では細粒度のコンテキストが損なわれ、1×1畳み込みに近づくことで性能が低下した。
  • 消去実験の結果、3層の統合(layers=3)が2層の統合よりも優れており、r₁=2、r₂=3の設定で最高の性能が得られた。
  • SLCモジュールはマスクレベルAPを10.98%向上させたが、ボックスレベルAPは3.0ポイントしか向上しなかったことから、主にマスクの精緻化に寄与していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。