Skip to main content
QUICK REVIEW

[論文レビュー] Lightweight Salient Object Detection in Optical Remote-Sensing Images via Semantic Matching and Edge Alignment

Gongyang Li, Zhi Liu|arXiv (Cornell University)|Jan 7, 2023
Visual Attention and Saliency Detection被引用数 5
ひとこと要約

本稿では、光学的宇宙探査画像における顕著オブジェクト検出のための軽量ネットワークであるSeaNetを提案する。高レベル特徴における動的意味的マッチングと低レベル特徴におけるエッジ自己整合性を活用することで、最小限の計算コストで高い精度を達成する。この手法は、軽量モデルの中で最先端の性能を発揮し、288×288の入力に対してわずか2.76Mパラメータと1.7G FLOPsで実行される。

ABSTRACT

Recently, relying on convolutional neural networks (CNNs), many methods for salient object detection in optical remote sensing images (ORSI-SOD) are proposed. However, most methods ignore the huge parameters and computational cost brought by CNNs, and only a few pay attention to the portability and mobility. To facilitate practical applications, in this paper, we propose a novel lightweight network for ORSI-SOD based on semantic matching and edge alignment, termed SeaNet. Specifically, SeaNet includes a lightweight MobileNet-V2 for feature extraction, a dynamic semantic matching module (DSMM) for high-level features, an edge self-alignment module (ESAM) for low-level features, and a portable decoder for inference. First, the high-level features are compressed into semantic kernels. Then, semantic kernels are used to activate salient object locations in two groups of high-level features through dynamic convolution operations in DSMM. Meanwhile, in ESAM, cross-scale edge information extracted from two groups of low-level features is self-aligned through L2 loss and used for detail enhancement. Finally, starting from the highest-level features, the decoder infers salient objects based on the accurate locations and fine details contained in the outputs of the two modules. Extensive experiments on two public datasets demonstrate that our lightweight SeaNet not only outperforms most state-of-the-art lightweight methods but also yields comparable accuracy with state-of-the-art conventional methods, while having only 2.76M parameters and running with 1.7G FLOPs for 288x288 inputs. Our code and results are available at https://github.com/MathLee/SeaNet.

研究の動機と目的

  • 光学的宇宙探査画像における顕著オブジェクト検出のための従来のCNNベースの手法が抱える高コストなパラメータと計算量の問題に対処すること。
  • モバイルおよびポータブルデプロイメントに適した、高精度を維持する軽量ネットワークの開発。
  • 専用モジュールを用いて低レベルおよび高レベル特徴を特徴的に処理することで、検出性能の向上。
  • 高レベル特徴における動的意味的マッチング機構と低レベル特徴におけるエッジ自己整合性機構の導入により、局所化精度と詳細の保持を向上。

提案手法

  • 光学的宇宙探査画像からの効率的特徴抽出のため、軽量バックボーンとしてMobileNet-V2を採用。
  • 高レベル特徴を意味的カーネルに圧縮し、動的畳み込みを適用して顕著オブジェクトの位置をマッチングする動的意味的マッチングモジュール(DSMM)を採用。
  • DSMM内にチャネル別相関機構を導入し、チャネル間の特徴相互作用を強化することで意味的表現を向上。
  • DSMMで拡張畳み込み型深度可分畳み込み(DDconvs)を適用し、パラメータを増加させずにマルチスケール顕著オブジェクトを捉える。
  • クロススケールのエッジ特徴を抽出し、L2損失を用いて整合化するエッジ自己整合モジュール(ESAM)を提案。
  • 洗練された高レベル意味的特徴と強化された低レベルエッジ特徴を統合するポータブルデコーダーを用い、正確な顕著マップを生成。

実験結果

リサーチクエスチョン

  • RQ1軽量ネットワークは、モデルサイズとFLOPsを著しく削減しながら、ORSI-SODで競争力ある性能を達成できるか?
  • RQ2圧縮された意味的カーネルを用いた動的意味的マッチングは、顕著オブジェクトの位置を的確に捉えるのにどの程度有効か?
  • RQ3計算コストを増加させずに、エッジ自己整合性は低レベル特徴における詳細の保持をどの程度向上させるか?
  • RQ4チャネルレベルおよび空間レベルの特徴相互作用は、提案されたモジュールの性能にどのように寄与しているか?

主な発見

  • SeaNetはEORSSDデータセットで平均Fβスコア0.8519を達成し、CorrNet や HVPNet を含む、他のすべての軽量ORSI-SOD手法を上回った。
  • 288×288の入力に対して2.76Mパラメータと1.7G FLOPsで実行されるが、PA-KRN(141.06Mパラメータ、617.7G FLOPs)のような最先端の従来手法よりも顕著に効率的である。
  • アブレーションスタディにより、DSMMおよびESAMのすべての構成要素が不可欠であることが確認された:空間マッチングを除いた(w/o SM)場合、Eξ_meanは0.9595に低下し、エッジ整合性を除いた(w/o alignment)場合、すべての指標で性能が低下した。
  • DSMMに拡張畳み込み型DDconvを適用することで、マルチスケールオブジェクトの認識が向上し、非拡張バージョンと比較してFβ_meanの性能低下が0.29%減少した。
  • DSMMおよびESAMにおけるチャネル別相関は重要であり、これを除去すると顕著な性能低下が生じ、チャネル間特徴相互作用の重要性を裏付けた。
  • HVPNet(1.23Mパラメータ、1.1G FLOPs)と同等のパラメータ(1.51M)とFLOPs(1.4G)を有するSeaNetの変種(例:SeaNet-SAM)は、Fβ_meanで10%以上も優れており、より優れた効率-精度トレードオフを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。