Skip to main content
QUICK REVIEW

[論文レビュー] Fast and Full-Resolution Light Field Deblurring using a Deep Neural Network

Jonathan Samuel Lumentut, Tae Hyun Kim|arXiv (Cornell University)|Mar 31, 2019
Advanced Image Processing Techniques参考文献 25被引用数 8
ひとこと要約

本論文では、6自由度(6-DOF)カメラ運動モデルを用いた高速かつフル解像度の光場のぼやけを解消するための深層ニューラルネットワークを提案する。実際の運動ぼやけを再現した大規模なぼやけ光場データセットを合成し、大きな受容 field を持つ再帰的畳み込み・逆畳み込みネットワークを訓練することで、フル解像度の光場において2秒未満で最先端のぼやけ解消品質を達成した。これは先行研究と比較して16,000倍速い。

ABSTRACT

Restoring a sharp light field image from its blurry input has become essential due to the increasing popularity of parallax-based image processing. State-of-the-art blind light field deblurring methods suffer from several issues such as slow processing, reduced spatial size, and a limited motion blur model. In this work, we address these challenging problems by generating a complex blurry light field dataset and proposing a learning-based deblurring approach. In particular, we model the full 6-degree of freedom (6-DOF) light field camera motion, which is used to create the blurry dataset using a combination of real light fields captured with a Lytro Illum camera, and synthetic light field renderings of 3D scenes. Furthermore, we propose a light field deblurring network that is built with the capability of large receptive fields. We also introduce a simple strategy of angular sampling to train on the large-scale blurry light field effectively. We evaluate our method through both quantitative and qualitative measurements and demonstrate superior performance compared to the state-of-the-art method with a massive speedup in execution time. Our method is about 16K times faster than Srinivasan et. al. [22] and can deblur a full-resolution light field in less than 2 seconds.

研究の動機と目的

  • 既存のブラインド光場ぼやけ解消手法の限界、すなわち処理が遅く、解像度が低下し、運動ぼやけモデルが単純化されていることに対処すること。
  • 高精度かつ高速にフル解像度の4次元光場をぼやけ解消できる学習ベースの手法を開発すること。
  • 3次元移動 + 3次元回転を含む6-DOF運動モデルを用いて、現実的で大規模なぼやけ光場データセットを生成すること。
  • 大規模な空間的・角度的解像度を保持したエンドツーエンドのぼやけ解消を、大きな有効受容 field を持つ深層ニューラルネットワークを用いて実現すること。

提案手法

  • 本手法は、実際の Lytro Illum 光場データと合成された3次元シーンレンダリングを用いて、6-DOFカメラ運動(3次元移動 + 3次元回転)下での大規模なぼやけ光場データセットを合成する。
  • 畳み込み層、逆畳み込み層、再帰層を組み合わせた深層ニューラルネットワークアーキテクチャを採用し、ネットワークの深さを大きくせずに大きな有効受容 field を実現する。
  • トレーニング中に角度方向サンプリングを適用することで、大規模な4次元光場データを効率的に処理し、一般化性能を向上させる。
  • ネットワークはエンドツーエンドで学習され、ぼやけ入力から直接シャープな光場出力を予測する。空間的および角度的解像度を完全に保持する。
  • 再帰的構造を統合することで、4次元光場ボリューム全体にわたり、特徴量を段階的に精練し、ぼやけ解消性能を向上させる。
  • トレーニングプロセスでは、合成データセットからのシャープな光場の真値を用いて、教師あり学習の枠組みでネットワークを監視する。

実験結果

リサーチクエスチョン

  • RQ1最適化ベースの手法と比較して、深層ニューラルネットワークが、大幅に短い推論時間でフル解像度の光場ぼやけ解消を達成できるか?
  • RQ2現実的な光場ぼやけ解消において、3-DOF移動モデルと比較して6-DOF運動ぼやけモデルがぼやけ解消性能をどのように向上させるか?
  • RQ3学習ベースのエンドツーエンドネットワークが、PSNR、SSIM、RMSE の観点から、従来の最適化ベースのぼやけ解消をどの程度上回るか?
  • RQ4非常に深いネットワークアーキテクチャを必要とせずに、再帰的ネットワークアーキテクチャが大きな有効受容 field を達成できるか?
  • RQ5提案手法は、トレーニング分布外の実世界のぼやけ光場データに対しても一般化できるか?

主な発見

  • 6-DOFテストセットにおいて、本手法はPSNR 27.57、SSIM 0.855を達成し、両方の定量的指標で先行する最先端手法を上回った。
  • 3-DOF運動ぼやけベンチマークでは、PSNR 27.21、SSIM 0.871を達成し、6-DOFデータで学習したにもかかわらず、優れた一般化性能を示した。
  • GPU上でフル解像度の光場を1.7秒未満で処理でき、Srinivasanらの[22]による先行SOTA手法と比較して16,000倍の高速化を達成した。
  • 定性的な結果から、特に大きな運動ぼやけ領域において、エッジやテクスチャの回復が優れており、サブアパーチャー画像間のEPI構造が一貫していることが確認された。
  • 外部ソースからの実世界のぼやけ光場データ、特にトレーニング中に見なかったデータに対しても、ネットワークは良好に一般化しており、視覚的比較でその有効性が示された。
  • アブレーションスタディにより、再帰的構造と角度方向サンプリング戦略が性能向上およびトレーニング効率の向上に顕著に寄与することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。