Skip to main content
QUICK REVIEW

[論文レビュー] Deep3D: Fully Automatic 2D-to-3D Video Conversion with Deep Convolutional Neural Networks

Junyuan Xie, Ross Girshick|arXiv (Cornell University)|Apr 13, 2016
Advanced Vision and Imaging参考文献 17被引用数 5
ひとこと要約

本稿では、3D映画のステレオペアを教師として用いることで、完全にエンドツーエンドの深層学習フレームワークであるDeep3Dを提案する。左右の視点ペアを直接学習させ、画素単位の再構成誤差を最小化することで、確率的視差マップを予測し、微分可能レンダリング層を介して右視点を再構築する。本手法は、真値深度の教師データや手動によるアノテーションを一切不要とし、最先端の性能を達成する。

ABSTRACT

As 3D movie viewing becomes mainstream and Virtual Reality (VR) market emerges, the demand for 3D contents is growing rapidly. Producing 3D videos, however, remains challenging. In this paper we propose to use deep neural networks for automatically converting 2D videos and images to stereoscopic 3D format. In contrast to previous automatic 2D-to-3D conversion algorithms, which have separate stages and need ground truth depth map as supervision, our approach is trained end-to-end directly on stereo pairs extracted from 3D movies. This novel training scheme makes it possible to exploit orders of magnitude more data and significantly increases performance. Indeed, Deep3D outperforms baselines in both quantitative and human subject evaluations.

研究の動機と目的

  • 手動による深度アノテーションや深度センサのデータを必要とせずに、完全に自動化された2Dから3Dへの動画変換の課題に取り組むこと。
  • 既存の3D映画から得られる大規模なステレオペアをエンドツーエンドで学習することで、従来の手法と比較して桁違いに多くのデータを活用し、性能を向上させること。
  • 視差予測とビュー合成を1つの微分可能ニューラルネットワークに統合することで、分離された深度推定とレンダリングの段階を排除すること。
  • 明示的な後処理による穴埋め処理を必要とせず、微分可能レンダリング層によってオクルージョンや欠損データを暗黙的に処理できること。
  • 定量的評価および人間被験による評価を通じて、最先端のベースラインを上回ることを実証するとともに、真値ステレオペアに非常に近い性能を示すことを目的とする。

提案手法

  • モデルは1枚の2D画像(左視点)を入力とし、深層畳み込みニューラルネットワークを用いて確率的視差マップを予測する。
  • 微分可能深度画像ベースレンダリング(DIBR)層が、予測された視差マップを用いて、入力画像から右視点を合成する。
  • ネットワークは、予測された右視点とステレオペアからの真値右視点との画素単位の再構成誤差を用いてエンドツーエンドで学習される。
  • アーキテクチャには、低レベル特徴からのスキップ接続と、細部の保持と特徴伝搬の向上を目的としたセレクション層が含まれる。
  • 時間的情報を活用するため、入力を複数の連続するRGBフレームまたはオプティカルフローのフレームに拡張する手法を検討したが、性能向上は限定的であった。
  • 真値深度マップの教師データを明示的に必要とせず、ステレオペアそのもので直接学習することで、スケーラブルなデータ活用が可能になる。

実験結果

リサーチクエスチョン

  • RQ1真値深度マップを必要とせず、ステレオペアを直接学習対象としてエンドツーエンドに訓練された深層ニューラルネットワークが、左視点から右視点を直接予測できるか。
  • RQ23D映画から得られる大規模なステレオデータをエンドツーエンドで学習することで、従来の2段階手法と比較して2Dから3Dへの変換性能が向上するか。
  • RQ3別個の穴埋めアルゴリズムを必要とせず、微分可能レンダリング層がオクルージョンや欠損データを暗黙的に処理できるか。
  • RQ4複数フレームやオプティカルフローを含む時間的情報の統合が、合成ステレオビューの品質にどのように影響するか。
  • RQ5人間の知覚テストにおいて、モデルの出力が真値ステレオペアと区別がつかない程度に近いか。

主な発見

  • 人間評価において、Deep3Dはナードなグローバル視差ベースラインを49%上回り、明確な知覚的改善を示した。
  • 人間被験評価では、Deep3Dの出力が真値を上回る割合が24.48%にのぼり、[10] + Oracleの10.27%、グローバル視差ベースラインの7.88%を上回った。
  • テストセットにおける平均絶対誤差(MAE)は6.87を達成した。アブレーションスタディでは、低レベル特徴を除去するかセレクション層を削除すると性能が低下することが示された。
  • ブロックマッチングによる視差推定を経てからレンダリングを行う手法と比較して、ステレオペアそのもので直接学習することでより良い結果が得られ、エンドツーエンド最適化の優位性が裏付けられた。
  • 5つの連続するRGBフレームまたはオプティカルフローを用いた時間的情報の統合により、MAEが6.81および6.86にわずかに改善されたが、向上幅は限定的であった。
  • モデルは動画入力に限定されず、静止画に対しても良好に一般化可能であるため、2D動画および静止写真の両方への応用が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。