Skip to main content
QUICK REVIEW

[論文レビュー] X-Fields: Implicit Neural View-, Light- and Time-Image Interpolation

Mojtaba Bemana, Karol Myszkowski|arXiv (Cornell University)|Oct 1, 2020
Advanced Vision and Imaging参考文献 65被引用数 12
ひとこと要約

本論文は、微分可能で幾何学に配慮したニューラルネットワークを用いて、2次元画像系列における視点、時間、照明を統合的に補間するニューラル暗黙表現X-Fieldsを提案する。ピクセルの運動を画像座標の学習可能なヤコビ行列としてモデル化することで、最小限の学習(数分)とコンパクトなストレージで20 Hzのリアルタイムかつ高精細なレンダリングを実現し、複雑な光輸送および細部再構築において最先端の手法を上回る性能を発揮する。

ABSTRACT

We suggest to represent an X-Field -a set of 2D images taken across different view, time or illumination conditions, i.e., video, light field, reflectance fields or combinations thereof-by learning a neural network (NN) to map their view, time or light coordinates to 2D images. Executing this NN at new coordinates results in joint view, time or light interpolation. The key idea to make this workable is a NN that already knows the "basic tricks" of graphics (lighting, 3D projection, occlusion) in a hard-coded and differentiable form. The NN represents the input to that rendering as an implicit map, that for any view, time, or light coordinate and for any pixel can quantify how it will move if view, time or light coordinates change (Jacobian of pixel position with respect to view, time, illumination, etc.). Our X-Field representation is trained for one scene within minutes, leading to a compact set of trainable parameters and hence real-time navigation in view, time and illumination.

研究の動機と目的

  • 高密度なサンプリングが不要な状態で、2次元画像系列における視点、時間、照明の高品質でリアルタイムな補間を可能にすること。
  • 動画、ライトフィールド、リフレクタンスフィールドにおける高次元サンプリング(例:5次元)に伴う指数的増大するストレージおよび処理負荷を解決すること。
  • 微分可能レンダリングの事前知識を活用し、視点、時間、光のパラメータにわたるシーン固有のコンパクトなニューラル表現を構築し、一般化を可能にすること。
  • 幾何学に配慮した一貫性駆動型ネットワークアーキテクチャにより、オクルージョン、ディソクルージョン、および複雑な光輸送(例:影、反射)の課題を克服すること。
  • 最小限のシーン別学習時間(20分未塔)で、インタラクティブなフレームレート(20 Hz)と高解像度出力(1024×1024)を達成すること。

提案手法

  • 本手法は、空間的位置、時間、照明を表す5次元座標(x, y, t, α, β)を入力とし、ピクセルカラーを出力するニューラルネットワークとしてX-Fieldを表現する。これは、学習可能なgetPixel関数を実装するものである。
  • 主なイノベーションは、3次元投影、照明、オクルージョンをモデル化するハードコードされた微分可能レンダリングパイプラインを統合し、ネットワークが画像形成の物理法則を暗黙的に学習できるようにすることである。
  • ネットワークは、視点、時間、照明座標に対するピクセル位置のヤコビアンを計算し、座標変更に伴うピクセルの動きを予測可能とする。これは、ディソクルージョンやオクルージョンに対処する上で極めて重要である。
  • 幾何的整合性を高めるために、一貫性重み付けを施したワーピングベースのアプローチを採用し、一貫性のないまたは曖昧な対応関係に起因するアーティファクトを低減する。
  • アーキテクチャは、学習可能なシーン表現と微分可能な画像形成モデルを組み合わせており、ネットワークは直接回帰を行うのではなく、空間的・時間的変換を推論することで画像カラーを予測する。
  • 学習は、スパarsely、不規則にサンプリングされた画像集合上でエンドツーエンドに実施され、ネットワークは観測された画像の再構築と、未観測座標への一般化を最適化する。

実験結果

リサーチクエスチョン

  • RQ11つのニューラルネットワークが、2次元画像系列の視点、時間、照明を統合的かつ暗黙的に補間できるか?
  • RQ23次元幾何学を明示的に定義せず、複雑な光輸送効果(例:影、反射、コウスタイクス)を暗黙的に学習できるように、ニューラルネットワークをどのように構築できるか?
  • RQ3微分可能で幾何学に配慮したレンダリング事前知識が、ディソクルージョンおよびオクルージョン領域における補間品質とアーティファクトの低減にどの程度寄与するか?
  • RQ4このような表現が、最小限のシーン別学習時間で、リアルタイムの推論(20 Hz)と高解像度出力(1024×1024)を達成できるか?
  • RQ5動的照明と運動を伴う複雑なシーンにおいて、本手法は古典的手法および最先端のディープラーニングベースラインと比較して、どの程度の性能を発揮するか?

主な発見

  • X-Field手法は、1024×1024解像度の画像に対して約20 Hzのリアルタイム推論を達成し、動的シーンのインタラクティブなVR探索を可能にする。
  • モデルは複雑な光輸送現象(ソフトシャドウ、グローバルイルミネーション、反射、コウスタイクスなど)に対して良好に一般化され、古典的手法およびディープラーニングベースラインを上回る性能を発揮する。
  • ピクセル位置のヤコビアンをモデル化することで、本手法はディソクルージョンおよびオクルージョンを効果的に処理し、標準的なワーピング手法でよく見られるラバースリーブ状の歪みアーティファクトを低減する。
  • 非常にスパarselyな入力(例:12枚程度)からでも高品質な補間を達成でき、画像データ以外のストレージオーバーヘッドは数キロバイト程度にとどまる。
  • アブレーションスタディの結果、一貫性重み付けおよび微分可能レンダリング事前知識の導入が、特に複雑な運動とオクルージョン領域において再構築品質を顕著に向上させていることが示された。
  • 一貫性重み付けを組み合わせることで、ノイズや泡のような確率的変動に対しても本手法は頑健であり、複数の視点間で一貫性のない特徴を抑制できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。