Skip to main content
QUICK REVIEW

[論文レビュー] Neural Graphics Pipeline for Controllable Image Generation

Xuelin Chen, Daniel Cohen‐Or|arXiv (Cornell University)|Jun 18, 2020
Computer Graphics and Visualization Techniques参考文献 36被引用数 4
ひとこと要約

Neural Graphics Pipeline (NGP) は、ニューラルレンダリングと従来の画像形成を組み合わせたハイブリッド生成モデルであり、制御可能な画像生成を可能にする。NGP は粗い 3D モデルを生成し、ニューラルレンダリングによって視点ごとの 2D マップをレンダリングし、従来のレンダリング手法を用いて合成することで、教師なし学習において明示的な画像対応が不要な状態で、照明、カメラ、形状、外観の制御が直接可能となり、FID スコアが向上する。

ABSTRACT

We present Neural Graphics Pipeline (NGP), a hybrid generative model that brings together neural and traditional image formation models. NGP generates coarse 3D models that are fed into neural rendering modules to produce view-specific interpretable 2D maps, which are then composited into the final output image using a traditional image formation model. Our approach offers control over image generation by providing direct handles controlling illumination and camera parameters, in addition to control over shape and appearance variations. The key challenge is to learn these controls through unsupervised training that links generated coarse 3D models with unpaired real images via neural and traditional (e.g., Blinn-Phong) rendering functions without establishing an explicit correspondence between them. We evaluate our hybrid modeling framework, compare with neural-only generation methods (namely, DCGAN, LSGAN, WGAN-GP, VON, and SRNs), report improvement in FID scores against real images, and demonstrate that NGP supports direct controls common in traditional forward rendering. Code, data, and trained models will be released on acceptance.

研究の動機と目的

  • 形状と外観を越えて、細かく制御可能な画像生成を可能にする生成モデルの開発。
  • ニューラルレンダリングと従来の画像形成モデルを統合し、制御性と現実性を向上させる。
  • 生成された 3D モデルと実際の画像の間で明示的な対応関係を必要としない教師なし学習によるモデル訓練。
  • 従来のレンダリングパイプラインと同様に、画像生成中に照明およびカメラパラメータの直接操作を可能にする。
  • FID スコアを指標として、ニューラルモデルのみに依存する手法と比較して、画像生成品質の最先端の性能を達成すること。

提案手法

  • NGP は画像合成の初期潜在表現として粗い 3D モデルを生成する。
  • ニューラルレンダリングモジュールは、3D ジオメトリと視点パラメータに条件付けられた、視点ごとの 2D フィーチャーマップを生成する。
  • 従来の画像形成モデル(例:Blinn-Phong)を用いて、レンダリングされた 2D マップを合成し、最終的な画像を生成する。
  • 微分可能なニューラルレンダリングおよび従来レンダリング関数を用いて、生成画像と実際の画像を一致させることで、教師なし学習を実施する。
  • 照明およびカメラパラメータの制御信号をレンダリングパイプラインに直接組み込み、エンドツーエンドの制御性を実現する。
  • 微分可能なレンダリングと adversarial 学習を活用することで、生成された 3D モデルと実際の画像の間で明示的な対応関係を回避する。

実験結果

リサーチクエスチョン

  • RQ1ハイブリッドなニューラル-従来レンダリングパイプラインは、照明およびカメラパラメータの直接操作を可能にする制御可能な画像生成を実現できるか?
  • RQ2生成された 3D モデルと実際の画像の間で明示的な対応関係を必要としないモデルは、純粋にニューラルな手法と比較して、どの程度の画像生成性能を発揮できるか?
  • RQ3ニューラルレンダリングと従来レンダリングを組み合わせることで、生成モデルにおける画像品質と制御性はどの程度向上するか?
  • RQ4NGP フレームワークは、従来のフォワードレンダリングパイプラインと同等の制御性を維持しながら、生成の柔軟性を保てるか?
  • RQ5FID スコアという指標において、NGP は DCGAN や WGAN-GP、SRNs といったニューラルオンリーモデルと比較して、どの程度の性能向上を達成できるか?

主な発見

  • NGP は、DCGAN や LSGAN、WGAN-GP、VON、SRNs といったニューラルオンリーモデルと比較して、より良い Fréchet Inception Distance (FID) スコアを達成する。
  • モデルは照明およびカメラパラメータの直接制御をサポートしており、従来のレンダリングパイプラインと同様の操作が可能である。
  • 明示的な 2D-3D 対応関係を必要としない教師なし学習スキームにより、粗い 3D モデルと実際の画像を効果的に結びつけることに成功した。
  • ハイブリッドアーキテクチャにより、形状、外観、照明、カメラ制御の分離性が向上し、画像品質も向上した。
  • フレームワークは、ニューラルレンダリングと従来レンダリングを組み合わせることで、制御性と生成の忠実度の両方を向上させられることを示した。
  • コード、データ、およびトレーニング済みモデルは受容後公開される予定であり、再現性およびさらなる研究を支援する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。