Skip to main content
QUICK REVIEW

[論文レビュー] Deep Illumination: Approximating Dynamic Global Illumination with Generative Adversarial Network

Manu Mathew Thomas, Angus G. Forbes|arXiv (Cornell University)|Oct 26, 2017
Advanced Vision and Imaging参考文献 23被引用数 17
ひとこと要約

Deep Illuminationは、Gバッファと直接照明を入力として用い、リアルタイムで高品質な動的グローバルライティングを近似する条件付き生成対抗ネットワーク(cGAN)を提案する。訓練が終了した後、モデルは新しいシーン構成に対して現実的な間接照明と柔らかい影を生成でき、品質ではVXGIを上回り、パストレーシングの速度を凌駕する。

ABSTRACT

We present Deep Illumination, a novel machine learning technique for approximating global illumination (GI) in real-time applications using a Conditional Generative Adversarial Network. Our primary focus is on generating indirect illumination and soft shadows with offline rendering quality at interactive rates. Inspired from recent advancement in image-to-image translation problems using deep generative convolutional networks, we introduce a variant of this network that learns a mapping from Gbuffers (depth map, normal map, and diffuse map) and direct illumination to any global illumination solution. Our primary contribution is showing that a generative model can be used to learn a density estimation from screen space buffers to an advanced illumination model for a 3D environment. Once trained, our network can approximate global illumination for scene configurations it has never encountered before within the environment it was trained on. We evaluate Deep Illumination through a comparison with both a state of the art real-time GI technique (VXGI) and an offline rendering GI technique (path tracing). We show that our method produces effective GI approximations and is also computationally cheaper than existing GI techniques. Our technique has the potential to replace existing precomputed and screen-space techniques for producing global illumination effects in dynamic scenes with physically-based rendering quality.

研究の動機と目的

  • 動的シーンにおいて、新しい照明やカメラ設定を伴ってリアルタイムで高品質なグローバルライティングを実現すること。
  • 事前計算されたライティングマップやスクリーンスペース技術の限界を克服し、Gバッファからグローバルライティングへの微分可能なマッピングを学習すること。
  • 生成モデルがスクリーンスペースデータから複雑なライティング効果を暗黙的に学習できるかを検証すること。
  • コンsumerハードウェアでトレーニング可能なGANの実現可能性を評価すること。
  • 未観測のシーン構成、特に新しいオブジェクトや照明設定への一般化能力を調査すること。

提案手法

  • Gバッファ(深度、法線、デフォルメ)と直接照明を入力として、グローバルライティング出力を生成する条件付きGAN(cGAN)を訓練する。
  • 教師あり学習のための高精度な真値としてパストレーシングを用い、写真同等の結果を保証する。
  • 空間的詳細を保持するためにスキップ接続を備えたU-Netベースのジェネレータを採用する。
  • 判別器を訓練し、パストレーシングから得た本物のグローバルライティングと生成された出力の区別を可能にする。
  • 生成の視覚的質を向上させるために、敵対的損失と知覚的損失を最適化する。
  • 訓練後、一般化能力を活用して未学習のシーン構成に対しても推論を可能にする。

実験結果

リサーチクエスチョン

  • RQ1ディープな生成モデルは、スクリーンスペースバッファから高視覚的品質のグローバルライティングを近似できるか?
  • RQ2訓練時に見られなかった新しいシーン構成に対して、トレーニング済みネットワークの一般化性能はどの程度か?
  • RQ3パストレーシングを真値として用いることで、VXGIを用いた場合と比較して収束が速くなり、より良い結果が得られるか?
  • RQ4ネットワークの深さと基本レイヤーのサイズは、推論速度と視覚的品質にどのように影響するか?
  • RQ5新しいオブジェクトやパーティクルシステムをレンダリングする際にどのようなアーティファクトが生じるか、そしてそれらは軽減可能か?

主な発見

  • パストレーシングの真値を用いて訓練したネットワークは、人間の評価において真値と見分けがつかない結果を生成し、明確な視覚的差異は認められなかった。
  • VXGIを用いても訓練した場合、高品質な間接照明と柔らかい影を生成でき、訓練データの品質にかかわらず高いロバスト性を示した。
  • 基本レイヤーK=128のネットワークはK=64やK=32よりも遅かったが、依然としてパストレーシングやVXGIよりも顕著に高速であり、リアルタイム実現可能性が確認された。
  • パストレーシングデータを用いた学習は、VXGIを用いた場合に比べて収束が早く、わずか10エポックで良好な結果が得られた。これは、より優れた特徴抽出が可能であることを示唆している。
  • パーティクルシステムや新しいオブジェクトをレンダリングする際にアーティファクトが発生したが、より多様な訓練データと高精度な真値を用いることで軽減された。
  • モデルは未観測のカメラ位置、光源の向き、オブジェクトの配置に対しても効果的に一般化でき、高品質なGIを伴う動的シーンレンダリングを実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。