Skip to main content
QUICK REVIEW

[論文レビュー] A high-precision underwater object detection based on joint self-supervised deblurring and improved spatial transformer network

Xiu-Yuan Li, Fengchao Li|arXiv (Cornell University)|Mar 9, 2022
Underwater Vehicles and Communication Systems被引用数 8
ひとこと要約

本稿では、共同自己教師付きぼかし除去ネットワークと改善された空間変換ネットワークを用いた高精度な水中オブジェクト検出(UOD)手法を提案する。自己教師付きぼかし除去によって特徴品質を向上させ、視点に基づく空間変換によって多視点特徴を豊かにすることで、URPC2017で47.9 mAP、URPC2018で70.3 mAPを達成し、最先端手法を上回る性能を発揮した。

ABSTRACT

Deep learning-based underwater object detection (UOD) remains a major challenge due to the degraded visibility and difficulty to obtain sufficient underwater object images captured from various perspectives for training. To address these issues, this paper presents a high-precision UOD based on joint self-supervised deblurring and improved spatial transformer network. A self-supervised deblurring subnetwork is introduced into the designed multi-task learning aided object detection architecture to force the shared feature extraction module to output clean features for detection subnetwork. Aiming at alleviating the limitation of insufficient photos from different perspectives, an improved spatial transformer network is designed based on perspective transformation, adaptively enriching image features within the network. The experimental results show that the proposed UOD approach achieved 47.9 mAP in URPC2017 and 70.3 mAP in URPC2018, outperforming many state-of-the-art UOD methods and indicating the designed method is more suitable for UOD.

研究の動機と目的

  • 水中オブジェクト検出における画像品質の劣化と多視点学習データの限定性という課題に対処すること。
  • 自己教師付きぼかし除去による特徴品質の向上により、検出精度を向上させること。
  • 視点に基づく空間変換ネットワークを用いて幾何変換を適応的に適用することで、多様な学習視点の欠如を補完し、特徴を豊かにすること。
  • ぼかし除去とオブジェクト検出を共同で最適化するマルチタスク学習アーキテクチャの構築

提案手法

  • 教師なしぼかし除去サブネットワークを検出フレームワークに統合し、ペアのクリア・ぼやけたデータを必要とせずに、ぼやけた水中画像からクリアな特徴を生成する。
  • 共有された特徴抽出モジュールをぼかし除去とオブジェクト検出の両方のタスクで共同最適化することで、頑健でクリアな特徴の学習を促進する。
  • 視点変換に基づく改善された空間変換ネットワークを設計し、幾何変換を用いて特徴表現を適応的に拡張する。
  • 検出ヘッドとぼかし除去ヘッドが同じバックボーンを共有するエンドツーエンド学習を採用するマルチタスク学習アーキテクチャを採用する。
  • 空間変換ネットワークは微分可能な空間サンプリングを用い、最適な特徴変換を学習することで、視点変動に対する不変性を向上させる。
  • 全体のアーキテクチャは、検出とぼかし除去の目的関数をバランスさせる組み合わせ損失関数を用いてエンドツーエンドで訓練する。

実験結果

リサーチクエスチョン

  • RQ1ペアのクリア・ぼやけたデータを必要とせずに、自己教師付きぼかし除去が水中オブジェクト検出における特徴品質を向上させることができるか?
  • RQ2限られた多視点学習データのもとで、視点に基づく空間変換ネットワークが特徴の多様性と頑健性をどれほど効果的に向上させられるか?
  • RQ3ぼかし除去と検出の共同最適化が、水中オブジェクト検出における全体のmAPにどの程度寄与するか?
  • RQ4提案手法は、標準的な水中検出ベンチマークにおいて、既存の最先端手法よりも一般化性能に優れているか?

主な発見

  • 提案手法はURPC2017ベンチマークで47.9 mAPを達成し、挑戦的な水中検出データセットにおいて強力な性能を示した。
  • URPC2018データセットでは70.3 mAPを達成し、複数の最先端水中オブジェクト検出手法を顕著に上回った。
  • 自己教師付きぼかし除去モジュールは、真値のクリア画像を必要とせずに画像特徴を効果的に回復させ、ペアデータへの依存を低減した。
  • 改善された空間変換ネットワークは、視点の変化を適応的にモデル化することで特徴表現を向上させ、検出の頑健性を向上させた。
  • マルチタスク学習フレームワークは、ぼかし除去と検出の目的関数を効果的にバランスさせ、優れた特徴品質と検出精度を実現した。
  • アブレーションスタディの結果、ぼかし除去部と空間変換ネットワークの両方が最終的な性能向上に顕著な貢献をしていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。