Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Deep Features for Remote Sensing Image Matching via Discriminator Network

Mohbat Tharani, Numan Khurshid|arXiv (Cornell University)|Oct 15, 2018
Advanced Image and Video Retrieval Techniques参考文献 21被引用数 4
ひとこと要約

本稿では、教師なしの深層特徴学習フレームワークを提案し、ラベルなしデータを用いてコン act で判別力のある特徴を抽出するための残差エンコーダ・デコーダネットワークを用いたリモートセンシング画像マッチング(RSIM)のためのものである。従来の距離尺度に代わり、類似対と非類似対を区別する非線形意思決定境界を学習する深層識別器ネットワークを導入し、ベンチマークデータセット上で最先端のmAP 81.2%を達成するとともに、コンテンツベースのリモートセンシング画像検索(CBRSIR)において12%の向上を達成した。

ABSTRACT

The advent of deep perceptual networks brought about a paradigm shift in machine vision and image perception. Image apprehension lately carried out by hand-crafted features in the latent space have been replaced by deep features acquired from supervised networks for improved understanding. However, such deep networks require strict supervision with a substantial amount of the labeled data for authentic training process. These methods perform poorly in domains lacking labeled data especially in case of remote sensing image retrieval. Resolving this, we propose an unsupervised encoder-decoder feature for remote sensing image matching (RSIM). Moreover, we replace the conventional distance metrics with a deep discriminator network to identify the similarity of the image pairs. To the best of our knowledge, discriminator network has never been used before for solving RSIM problem. Results have been validated with two publicly available benchmark remote sensing image datasets. The technique has also been investigated for content-based remote sensing image retrieval (CBRSIR); one of the widely used applications of RSIM. Results demonstrate that our technique supersedes the state-of-the-art methods used for unsupervised image matching with mean average precision (mAP) of 81%, and image retrieval with an overall improvement in mAP score of about 12%.

研究の動機と目的

  • ディープラーニング応用におけるリモートセンシングデータのラベル不足問題に対処すること。
  • 大規模なラベル付きデータセットを必要とする教師ありCNNの限界を克服すること。
  • 従来の距離尺度(例:ユークリッド距離、コサイン類似度)を、学習された判別的メカニズムに置き換えることにより、画像マッチング性能を向上させること。
  • 多様なリモートセンシング画像ドメインに適した、強力な教師なし特徴抽出手法を開発すること。
  • 反復的関連フィードバックを必要とせずに、コンテンツベースのリモートセンシング画像検索(CBRSIR)の性能を向上させること。

提案手法

  • リモートセンシング画像から教師なしの深層特徴を学習するための残差エンコーダ・デコーダアーキテクチャを活用する。
  • オートエノードのボトルネック層から特徴を抽出し、コンパクトな視覚的記述子として用いる。
  • 画像特徴ペアを類似または非類似と分類するための深層残差識別器ネットワークを訓練する。
  • 従来の尺度に代わり、識別器の出力を学習された類似度スコアとして使用する。
  • 対照的損失を用いて、正例ペアと負例ペアの間の非線形意思決定境界をEnd-to-Endで学習する。
  • 2つの公開リモートセンシングデータセットを用いて、RSIMおよびCBRSIRの両タスクに本フレームワークを適用する。

実験結果

リサーチクエスチョン

  • RQ1オートエノードアーキテクチャを用いて抽出された教師なしの深層特徴は、マッチングタスクにおいてリモートセンシング画像を効果的に表現できるか?
  • RQ2教師なし設定において、深層識別器ネットワークは従来の距離尺度(例:ユークリッド距離、コサイン類似度)よりも、類似対と非類似対を区別する能力に優れているか?
  • RQ3提案されたフレームワークは、ラベルなしデータや関連フィードバックを必要とせずに、コンテンツベースのリモートセンシング画像検索で最先端の性能を達成できるか?
  • RQ4幾何的変化(回転や平行移動など)に対して、本手法はどれほど頑健か?
  • RQ5識別器ネットワークは、多様なリモートセンシング画像クラスにどれほど一般化可能か?

主な発見

  • 提案手法はLandUseデータセットでmAP 81.2%を達成し、最先端の教師なし手法を上回った。
  • コンテンツベースのリモートセンシング画像検索において、既存の手法と比較してmAPを約12%向上させた。
  • LandUseデータセットではトップ10の検索精度が99.2%、SatSceneデータセットでは99.8%に達し、検索結果の関連性が極めて高いことが示された。
  • 回転や平行移動を伴うオブジェクト(例:交差点、タンク)に対しても、モデルは強固な性能を維持しており、頑健性が裏付けられた。
  • 混同行列から、飛行機とタンク、テニスコートと高速道路が視覚的類似性のため最も頻繁に混同されていることが分かった。
  • 本手法により、反復的関連フィードバックの必要性が排除され、リモートセンシング応用におけるアノテーション負荷が顕著に低減された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。