Skip to main content
QUICK REVIEW

[論文レビュー] Additional Representations for Improving Synthetic Aperture Sonar Classification Using Convolutional Neural Networks

Isaac D. Gerg, David P. Williams|arXiv (Cornell University)|Aug 8, 2018
Underwater Acoustics Research参考文献 10被引用数 6
ひとこと要約

本論文は、合成孔径レーダー(SAS)標的分類の性能向上を図るために、未利用にされていた信号表現——特に単一画素複素(SLC)画像の位相の2次元パワースペクトル密度(PSD)および事前学習済みImageNet CNNのファインチューニング——を活用することを提案する。複数の表現を組み合わせることで、AUCが向上し、特徴空間間の相互情報量が増加するという結果が得られ、分類性能が向上した。

ABSTRACT

Object classification in synthetic aperture sonar (SAS) imagery is usually a data starved and class imbalanced problem. There are few objects of interest present among much benign seafloor. Despite these problems, current classification techniques discard a large portion of the collected SAS information. In particular, a beamformed SAS image, which we call a single-look complex (SLC) image, contains complex pixels composed of real and imaginary parts. For human consumption, the SLC is converted to a magnitude-phase representation and the phase information is discarded. Even more problematic, the magnitude information usually exhibits a large dynamic range (>80dB) and must be dynamic range compressed for human display. Often it is this dynamic range compressed representation, originally designed for human consumption, which is fed into a classifier. Consequently, the classification process is completely void of the phase information. In this work, we show improvements in classification performance using the phase information from the SLC as well as information from an alternate source: photographs. We perform statistical testing to demonstrate the validity of our results.

研究の動機と目的

  • SAS標的分類において、大部分が無害な海底画像であるデータ不足かつクラス不均衡問題に対処すること。
  • 未利用にされていたSLC表現——特に位相とその導出されたPSD——が分類器性能を向上させることを調査すること。
  • SAS強度画像上で、市販の事前学習済みCNN(VGG-16)をファインチューニングすることによるトランスファー学習の検討。
  • 異なる入力が学習された表現に与える影響およびモodal間の協調性を理解するために、内部特徴表現を分析すること。

提案手法

  • 動的レンジ圧縮強度、原始位相、およびSLC画像の2次元パワースペクトル密度(PSD)という複数のSAS画像表現を用いて、スキップ接続とReLU活性化関数を備えたカスタムCNNアーキテクチャを訓練する。
  • 強度とPSDのための並列ブランチを持つマルチインプットCNN設計を採用し、最終層の前で特徴を連結することで、共同学習を可能にする。
  • 自然画像から学習された特徴を活用するために、SAS強度画像上で事前学習済みVGG-16ネットワークをファインチューニングすることでトランスファー学習を適用する。
  • 訓練の確率的変動を考慮するため、受信者操作特性曲線下の面積(AUC)指標を用いて性能を評価し、統計的有意性の検定を実施する。
  • 訓練中にラベル情報を使用せずに、特徴空間の活性化をt-SNE可視化することで、試行ごとの非教師付きクラスタリングパターンを分析する。
  • 異なる入力モダリティ間の統計的依存度を測定するために、内部特徴表現間の相互情報量(MI)を測定する。

実験結果

リサーチクエスチョン

  • RQ1複素数のSLC画像から導出される表現——特に位相とそのPSD——は、強度のみを入力とする場合に比べ、SAS分類性能を向上させることができるか?
  • RQ2強度とPSDなどの複数の表現を組み合わせることで、分類器性能に相乗効果が得られるか?
  • RQ3自然画像で事前学習された市販のCNN(ImageNet VGG-16)をSAS標的分類に効果的にファインチューニングできるか?
  • RQ4訓練時に試行ラベルを用いなくても、内部特徴表現に意味のある構造——例えば、試行名ごとの非教師付きクラスタリング——が現れるか?
  • RQ5複数の入力を同時に学習する場合と個別に学習する場合とで、特徴空間間の相互情報量はどのように変化するか?

主な発見

  • SLC位相の2次元パワースペクトル密度(PSD)を組み込むことで、強度のみの入力に比べてAUCが顕著に向上し、従来無視されていた位相情報の有効性が示された。
  • 強度+PSDネットワークが最も高いAUCを達成し、強度のみおよびPSDのみのベースラインに比べて統計的に有意な改善が得られた。
  • 複数の表現を同時に学習させた場合、特に強度とPSD間で特徴空間間の相互情報量(MI)が増加し、特徴の協調性が向上した。
  • 非教師付きt-SNE可視化により、訓練時に試行ラベルを一切使用しなかったにもかかわらず、強度+PSDネットワークでは試行名ごとに明確なクラスタリングが特徴点に現れた。
  • CNNの1層目の畳み込みフィルタは人間が解釈可能であり、入力表現内のエッジやテクスチャといった物理的特徴に感度を示した。
  • ImageNetで事前学習済みのVGG-16ネットワークをSAS強度画像上でファインチューニングした結果、優れた分類性能が得られ、SAS ATRにおけるトランスファー学習の有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。