Skip to main content
QUICK REVIEW

[論文レビュー] Simultaneous Enhancement and Super-Resolution of Underwater Imagery for Improved Visual Perception

Md Jahidul Islam, Peigen Luo|arXiv (Cornell University)|Feb 4, 2020
Image Enhancement Techniques被引用数 10
ひとこと要約

本稿では、残差内残差ネットワークを用いた統合的深層学習フレームワークであるDeep SESRを提案する。このフレームワークは、4倍までのスーパーレゾリューションを同時に実行しながら水中画像の品質を向上させる。マルチモーダル損失を用いて知覚的強調、スーパーレゾリューション、および顕著性予測を共同で学習し、水中および地上画像において最先端の性能を達成するとともに、NVIDIA AGX Xavierなどのシングルボードプラットフォームでもリアルタイム推論を可能にする。

ABSTRACT

In this paper, we introduce and tackle the simultaneous enhancement and super-resolution (SESR) problem for underwater robot vision and provide an efficient solution for near real-time applications. We present Deep SESR, a residual-in-residual network-based generative model that can learn to restore perceptual image qualities at 2x, 3x, or 4x higher spatial resolution. We supervise its training by formulating a multi-modal objective function that addresses the chrominance-specific underwater color degradation, lack of image sharpness, and loss in high-level feature representation. It is also supervised to learn salient foreground regions in the image, which in turn guides the network to learn global contrast enhancement. We design an end-to-end training pipeline to jointly learn the saliency prediction and SESR on a shared hierarchical feature space for fast inference. Moreover, we present UFO-120, the first dataset to facilitate large-scale SESR learning; it contains over 1500 training samples and a benchmark test set of 120 samples. By thorough experimental evaluation on the UFO-120 and other standard datasets, we demonstrate that Deep SESR outperforms the existing solutions for underwater image enhancement and super-resolution. We also validate its generalization performance on several test cases that include underwater images with diverse spectral and spatial degradation levels, and also terrestrial images with unseen natural objects. Lastly, we analyze its computational feasibility for single-board deployments and demonstrate its operational benefits for visually-guided underwater robots. The model and dataset information will be available at: https://github.com/xahidbuffon/Deep-SESR.

研究の動機と目的

  • 水中ロボティクスにおける色収差、ぼやけ、低コントラストに起因する視認性の低下という課題に対処すること。
  • 画像強調とスーパーレゾリューションを1つの計算効率の高いフレームワークに統合し、近似的にリアルタイムなロボットアプリケーションを実現すること。
  • 同時に強調とスーパーレゾリューションモデルのトレーニングとベンチマークに使用可能な大規模かつアノテーション済みのデータセット(UFO-120)を構築すること。
  • 最小限の計算オーバーヘッドで、多様な水中および地上画像環境においても強力で一般化可能な性能を実現すること。
  • 単一のボードコンピュータ上でモデルをデプロイ可能であることを実証し、リアルタイムで視覚誘導型水中ロボット作業を実現すること。

提案手法

  • Deep SESRは、強調とスーパーレゾリューションのための共有された階層的特徴抽出を備えた残差内残差U-Netアーキテクチャを採用している。
  • モデルは、色の劣化、シャープネス、コントラスト、および高レベル特徴表現を改善するため、知覚的損失、 adversarial 損失、構造的損失を組み合わせたマルチモーダル損失関数でトレーニングされる。
  • 顕著性予測はスーパーレゾリューションと共同でトレーニングされ、密度勾配推定を用いた注目領域(RoI)選択が注目ドリブンで可能になる。
  • ネットワークはFENet-1dおよびFENet-2dを特徴抽出バックボーンとして使用しており、FENet-2dは並列に3×3および5×5フィルタを用いることで特徴表現を向上させている。
  • エンドツーエンドのトレーニングパイプラインにより、共有特徴空間上で強調、スーパーレゾリューション、顕著性予測の最適化が同時に実行される。
  • モデルは分離推論をサポートしており、NVIDIA AGX Xavier上で顕著性と強調の分離ブランチ(10.02 FPS)またはフルSESR(7.75 FPS)を実行可能である。

実験結果

リサーチクエスチョン

  • RQ11つのディープラーニングモデルが水中ビジョンシステムにおいて、同時に画像強調とスーパーレゾリューションを効果的に行えるか?
  • RQ2顕著性予測の共同学習が、知覚的品質の向上と効率的なRoIベース処理をどのように促進するか?
  • RQ3Deep SESRモデルは、水中および地上画像におけるPSNR、SSIM、UIQMの観点から、既存の最先端手法に比べてどの程度の性能向上を達成するか?
  • RQ4モデルは、未観測の水中環境および自然な地上シーンに対してもどの程度一般化可能か?
  • RQ5このようなモデルを組み込み型シングルボードプラットフォームにデプロイする上で、計算上の実現可能性はどの程度か?

主な発見

  • Deep SESRはUFO-120データセットで最先端の性能を達成し、2×、3×、4×スーパーレゾリューションにおけるPSNRスコアはそれぞれ26.14、26.89、21.05を記録し、先行手法を上回っている。
  • Set5における4×スーパーレゾリューションでSSIM 0.925、UIQM 0.855を達成し、優れた知覚的品質と色再現性を示している。
  • Sun80データセットでは、2×でSSIM 0.802、PSNR 25.73を達成しており、自然画像への強い一般化能力を示している。
  • NVIDIA AGX Xavier上では7.75 FPS(129 ms/フレーム)で実行可能で、メモリ使用量は10 MBであり、組み込み型ロボティクスデプロイメントに適している。
  • 顕著性と強調ブランチを分離することで推論速度が10.02 FPSに向上し、追加で25 msで詳細な分析が可能なリアルタイムRoI処理が可能になった。
  • 定性的な結果から、色、コントラスト、シャープネスの回復が、多様なスペクトル的および空間的劣化に対しても効果的に実現されていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。