Skip to main content
QUICK REVIEW

[論文レビュー] Synthetic Defocus and Look-Ahead Autofocus for Casual Videography

Xuaner Zhang, Kevin Matzen|arXiv (Cornell University)|May 15, 2019
Image Processing Techniques and Applications参考文献 61被引用数 4
ひとこと要約

本論文では、スマートフォンで記録された深景深度(DOF)映像から再焦点可能映像を合成し、将来のフレームをAIで予測する見通し分析を用いて、被写体の動きを予測してフォーカス遷移を最適化するRVR-LAAFというシステムを紹介する。主な貢献は、リアルタイムフォーカス制御の限界を克服し、将来の状況に配慮したフォーカス意思決定を可能にする新規フレームワークの構築であり、不規則な動きに対しても滑らかで正確な被写体追跡を実現する。

ABSTRACT

In cinema, large camera lenses create beautiful shallow depth of field (DOF), but make focusing difficult and expensive. Accurate cinema focus usually relies on a script and a person to control focus in realtime. Casual videographers often crave cinematic focus, but fail to achieve it. We either sacrifice shallow DOF, as in smartphone videos; or we struggle to deliver accurate focus, as in videos from larger cameras. This paper is about a new approach in the pursuit of cinematic focus for casual videography. We present a system that synthetically renders refocusable video from a deep DOF video shot with a smartphone, and analyzes future video frames to deliver context-aware autofocus for the current frame. To create refocusable video, we extend recent machine learning methods designed for still photography, contributing a new dataset for machine training, a rendering model better suited to cinema focus, and a filtering solution for temporal coherence. To choose focus accurately for each frame, we demonstrate autofocus that looks at upcoming video frames and applies AI-assist modules such as motion, face, audio and saliency detection. We also show that autofocus benefits from machine learning and a large-scale video dataset with focus annotation, where we use our RVR-LAAF GUI to create this sizable dataset efficiently. We deliver, for example, a shallow DOF video where the autofocus transitions onto each person before she begins to speak. This is impossible for conventional camera autofocus because it would require seeing into the future.

研究の動機と目的

  • カジュアルなビデオ撮影におけるリアルタイムカメラフォーカスの根本的制限に取り組むこと。これは、予測不能な被写体の動きとシナリオに基づくガイドラインの欠如によるフォーカスエラーが原因である。
  • スマートフォンの小型センサーと固定フォーカスのため、従来は映画的なボケ味(ボケ)を犠牲にしていたが、その浅い被写界深度の実現を可能にすること。
  • 人物が話し始めることなどの決定的行動を予測できない従来のフォーカス制御の限界を克服し、「将来に配慮した」フォーカス意思決定を可能にすること。
  • 機械学習、物理ベースレンダリング、時間的整合性を統合したエンドツーエンドの実用的システムを開発すること。
  • AI支援の見通し分析によるフォーカス制御が、リアルタイムカメラシステムに比べてフォーカスの正確性と遷移の滑らかさを著しく向上させることを実証すること。

提案手法

  • 2,000組以上の画像ペア/トリプレット(露出と焦点設定が異なる)で構成される新規データセットを用いてトレーニングされたディープラーニングモデルにより、合成された再焦点可能映像を生成する。
  • 予測された深度マップ、HDR推定、レンズ固有のぼかしカーネルを組み合わせた物理ベースレンダリングモデルを採用し、映画的なボケ味を再現する浅い被写界深度をシミュレートする。
  • 時間的整合性を確保するため、フレーム間のぼかし遷移を安定化させるフィルタリング手法を採用し、ちらつきや不整合を低減する。
  • 見通しフォーカス(LAAF)は、AIモジュールを用いて将来の映像フレームの動き、顔検出、音声活動、注目度を分析し、フォーカスのターゲットを予測する。
  • LAAFフレームワークは、ラベル付けのためのGUI(RVR-LAAF)を用い、大規模な動画データセットにフォーカス遷移を効率的にアノテートする。
  • 将来のフレームの予測的分析に基づいたフォーカス意思決定により、被写体が話し始める前にフォーカスを移動できる。これは、リアルタイムカメラフォーカスでは不可能な機能である。

実験結果

リサーチクエスチョン

  • RQ1機械学習と物理ベースレンダリングを用いて、スマートフォンで記録された深景深度映像から信頼性の高い再焦点可能映像を生成できるか?
  • RQ2将来のフレーム分析により、リアルタイムカメラシステムに比べてより正確で先読み型のフォーカス意思決定が可能になるか?
  • RQ3AI支援の見通しフォーカスは、動的な被写体の追跡や、物語の重要なアクションの前触れにフォーカスを移動させる能力において、どの程度効果的か?
  • RQ4時間的フィルタリングは、合成された再焦点可能映像における視覚的一致性をどの程度向上させるか?
  • RQ5学習された深度マップとHDRマップを用いて、アノマorphicレンズのぼかし効果などの映画的ボケを再現できるか?

主な発見

  • RVR-LAAFシステムは、学習された深度マップとHDR推定を用いて、スマートフォンで記録された深景深度映像から再焦点可能映像を生成し、視覚的品質と時間的安定性を向上させた。
  • 見通しフォーカスにより、話し始めの直前までに話者のフォーカスを移動できる。これは、従来のリアルタイムフォーカスシステムでは不可能な機能である。
  • 動きの速い被写体、例えばサッカー選手のような被写体に対しても、行動を事前に予測しフォーカスを事前に移動させることで、優れたフォーカス追跡を実現した。
  • プロの映画撮影用レンズの特性を反映したレンズ固有のぼかしカーネルをモデル化することで、非円形のぼかし効果も含めた正確な映画的ボケの再現に成功した。
  • 高級DSLRカメラと比較した側面評価では、被写体の急な入れ替えが生じる状況において、RVR-LAAFがフォーカス遷移の正確性において優れていることが確認された。
  • 専用の時間的安定化モジュールにより、ぼかしのちらつきを顕著に低減し、合成映像における視覚的一致性を著しく向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。