Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Deblur using Light Field Generated and Real Defocus Images

Lingyan Ruan, Bin Chen|arXiv (Cornell University)|Apr 1, 2022
Image Processing Techniques and Applications被引用数 5
ひとこと要約

本論文は、最初に光場から生成された画像ペアを用いて正確なピクセル単位の対応関係を学習し、その後に実際の2ショット撮影データを用いて特徴量損失を適用してドメインギャップを埋める2段階のディーブラーニング手法を提案する。このアプローチにより、合成された光場データの正確さと現実のぼかしのリアルさを組み合わせ、複数のベンチマークで最先端の性能を達成した。

ABSTRACT

Defocus deblurring is a challenging task due to the spatially varying nature of defocus blur. While deep learning approach shows great promise in solving image restoration problems, defocus deblurring demands accurate training data that consists of all-in-focus and defocus image pairs, which is difficult to collect. Naive two-shot capturing cannot achieve pixel-wise correspondence between the defocused and all-in-focus image pairs. Synthetic aperture of light fields is suggested to be a more reliable way to generate accurate image pairs. However, the defocus blur generated from light field data is different from that of the images captured with a traditional digital camera. In this paper, we propose a novel deep defocus deblurring network that leverages the strength and overcomes the shortcoming of light fields. We first train the network on a light field-generated dataset for its highly accurate image correspondence. Then, we fine-tune the network using feature loss on another dataset collected by the two-shot method to alleviate the differences between the defocus blur exists in the two domains. This strategy is proved to be highly effective and able to achieve the state-of-the-art performance both quantitatively and qualitatively on multiple test sets. Extensive ablation studies have been conducted to analyze the effect of each network module to the final performance.

研究の動機と目的

  • 単一画像ぼかし回復における空間的に変化するぼかしの課題に対処すること。特に、ピクセル単位の正確な対応関係を持つ訓練データが不足している点に焦点を当てる。
  • 光場から生成された合成ぼかしと、従来のカメラで得られる現実のぼかしとの間のドメインギャップを克服すること。
  • 光場生成画像と現実世界のぼかし画像ペアの両方の利点を活かすディープラーニングフレームワークの開発を目的とする。
  • 光場データから得られる高精度な対応関係と、現実のデータから得られるリアルなぼかし特性を組み合わせることで、ぼかし回復性能を向上させること。
  • 細部の回復に寄与する、新規の動的残差ブロックとマルチスケール特徴量学習の有効性を検証すること。

提案手法

  • 本手法は2段階トレーニング戦略を採用する。まず、光場合成アパーチャーから得られる正確なピクセル単位の対応関係を活用して、LFDOFデータセットを用いて平均絶対誤差(MAE)損失で事前学習を行う。
  • 次に、DPDDおよびRealDOFデータセットを用いて、知覚的特徴量損失を適用して微調整を行い、現実のぼかし特徴に適応させる。
  • 空間的に変化するぼかしを扱うために、適応的残差特徴量、動的カーネルサイズ、マルチスケール精錬を組み合わせた新規の動的残差ブロック(DRB)を導入する。
  • DRBは、各レイヤーごとに学習可能なカーネルサイズを採用しており、複雑なぼかしパターンのモデリングにおいて柔軟性を向上させる。
  • 高周波成分の段階的回復を実現するため、粗いものから細かいものへのマルチスケールアーキテクチャを採用する。
  • 微調整段階では、復元画像と正解画像の特徴表現を一致させるために特徴量損失を適用し、知覚的品質の向上を図る。

実験結果

リサーチクエスチョン

  • RQ1光場生成画像と現実のぼかし画像ペアを組み合わせることで、単一画像ぼかし回復における一般化性能と性能が向上するか?
  • RQ2光場から生成されたぼかしと現実のカメラぼかしとの間のドメインギャップがぼかし回復性能に与える影響は何か? また、そのギャップはどのように軽減できるか?
  • RQ3提案された動的残差ブロック(DRB)の各構成要素(残差特徴量、動的カーネル、残差精錬)が最終的なぼかし回復品質に果たす寄与度は何か?
  • RQ4明示的なぼかしマップ推定を伴わないエンドツーエンド学習は、まずぼかしマップを推定する2段階手法を上回る性能を発揮するか?
  • RQ5DRBにおける動的カーネルサイズが、異なるデータセットにおける回復性能に与える影響は何か?

主な発見

  • 提案手法はRealDOFデータセットでPSNR 25.745を達成し、先行手法を大きく上回った。
  • アブレーションスタディの結果、動的残差ブロック(残差特徴量、動的カーネル、残差精錬)のすべての構成要素が最適性能を発揮するために不可欠であることが確認された。
  • 2段階戦略(光場での事前学習+現実データでの微調整)で学習したモデルは、いずれのデータセット単独で学習した場合よりも優れた一般化性能を示した。
  • 明示的なぼかしマップ推定を用いないにもかかわらず、LFDOFテストセットにおいてAIFNetを0.726 dB上回った。
  • 最適な動的カーネルサイズは、RealDOFでは7、DPDDでは9であり、性能とパrameter効率のバランスを考慮して7が採用された。
  • 定性的な結果から、唯一、完全なDRB構成でのみ細かいディテールと現実的なテクスチャが回復されており、アーキテクチャ的要因の重要性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。