Skip to main content
QUICK REVIEW

[論文レビュー] Atmospheric turbulence removal using convolutional neural network

Jing Gao, Nantheera Anantrasirichai|arXiv (Cornell University)|Dec 22, 2019
Advanced Image Processing Techniques参考文献 13被引用数 16
ひとこと要約

本稿では、修正された残差U-Netアーキテクチャを用いた深層学習ベースの手法を提案し、大気乱流によって損なわれた動画シーケンスの復元を実現する。空間的・時間的残差学習とバッチ正規化を活用したエンド・トゥ・エンドの訓練により、ぼやけやリップル効果を効果的に除去し、コントラストを向上させる。実世界のデータにおいて、最先端手法と比較して最高で3.8%高いPSNRを達成し、推論速度は23倍速くなった。

ABSTRACT

This paper describes a novel deep learning-based method for mitigating the effects of atmospheric distortion. We have built an end-to-end supervised convolutional neural network (CNN) to reconstruct turbulence-corrupted video sequence. Our framework has been developed on the residual learning concept, where the spatio-temporal distortions are learnt and predicted. Our experiments demonstrate that the proposed method can deblur, remove ripple effect and enhance contrast of the video sequences simultaneously. Our model was trained and tested with both simulated and real distortions. Experimental results of the real distortions show that our method outperforms the existing ones by up to 3.8% in term of the quality of restored images, and it achieves faster speed than the state-of-the-art methods by up to 23 times with GPU implementation.

研究の動機と目的

  • 従来の画像処理手法には、計算コストが高く、最適化が複雑で、手動によるパrameterチューニングが必要なため、大気乱流の復元に限界があることに対処すること。
  • ぼやけの除去、リップルの除去、コントラストの向上を同時に実現できるエンド・トゥ・エンドの深層学習フレームワークを構築すること。
  • 高品質なフレームの事前選択を必要とせず、1フレームまたは複数フレームの平均入力のみで、リアルタイムかつ即時の動画シーケンスの復元を可能にすること。
  • DnCNNアーキテクチャを拡大された受容 field と残差学習で変更することで、複雑で未知の大気乱流パターンを有する実世界のシーンにおいても、より高い耐性と性能を実現すること。

提案手法

  • 本手法は、DnCNNに基づく修正されたU-Netに類似した残差畳み込みニューラルネットワーク(CNN)を採用し、空間的・時間的歪みを捉えるために受容 field を拡大する目的でフィルターサイズを $ n \times n $($ n > 3 $)に拡大している。
  • 入力と正解の差分をモデル化するために残差学習を用い、損失関数は平均二乗誤差として定義される:$ L(\theta) = \frac{1}{2m} \sum_{i=1}^{m} |R(y_i;\theta) - (y_i - x_i)|^2 $。
  • 再構成誤差を最小化する目的で、バックプロパゲーションを用いて歪みあり画像と正解画像のペairedデータ上でネットワークを学習する。
  • 2つの入力戦略(1フレーム入力、20~30フレームの平均化入力)を評価し、後者の方が複雑な実世界のシーンにおいて安定性と性能が向上することが示された。
  • 各層にバッチ正規化を適用することで、学習の加速と収束性の向上を図っている。
  • GPUアクセラレーションにより実装されており、512×256の動画フレームで1秒間に1638.4kピクセルの処理速度を達成し、リアルタイム処理を実現している。

実験結果

リサーチクエスチョン

  • RQ1大気乱流によって引き起こされる複雑な空間的・時間的歪みを、深層CNNが効果的に学習し逆方向に復元できるか?
  • RQ2より大きな受容 field を有する残差学習を用いることで、標準的なDnCNNと比較して、乱流除去の品質が向上するか?
  • RQ3本手法は1つの歪みありフレーム入力で優れた性能を達成できるか、それとも実世界のデータにおいて安定した結果を得るにはマルチフレーム平均化が不可欠か?
  • RQ4特にリアルタイム環境下において、CW や CSP といった既存の最先端手法と比較して、本手法の速度と品質はどのように優れているか?

主な発見

  • 本手法は実世界のデータセットにおいて、最先端手法を最高で3.8%高いPSNRで上回り、'chimney'シーケンスで最高のPSNR 33.68 dBを達成した。
  • 'building'シーケンスでは、平均化入力でPSNR 26.02 dBを達成し、CSP(25.37 dB)とCW(25.18 dB)を上回った。
  • GPU上で1フレームあたり0.08秒(1秒間に1638.4kピクセル)の処理速度を達成し、CW手法(1秒間に70.6kピクセル)と比較して23倍速くなった。
  • 主観的評価では、CSP や CW と比較して、本手法が細部の保持やアーティファクトの低減において視覚的に優れた結果をもたらした。
  • 平均化されたマルチフレーム入力は、復元品質を著しく向上させ、'chimney'シーケンスでは最高のSSIM(0.97)、'building'シーケンスでは0.88を達成し、CW や CSP を上回った。
  • 動く物体を含む動的シーン(例:'moving car'シーケンス)に対しても、本手法は高い耐性を示し、平均化入力により正解に近い結果を出力し、既存手法を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。