Skip to main content
QUICK REVIEW

[論文レビュー] 3D-aware Image Generation using 2D Diffusion Models

Jianfeng Xiang, Jiaolong Yang|arXiv (Cornell University)|Mar 31, 2023
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

本論文は、2D拡散モデルを活用して、複数視点の画像生成を段階的無条件・条件付きサンプリングプロセスとして定式化することにより、3Dに注意を向けた画像生成手法を提案する。ImageNetにおいて最先端の性能を達成し、一方向の深度推定とデータ拡張を用いて、アライメントのとれていない、現実世界の画像から高精細で360°一貫性のある視点を生成する。

ABSTRACT

In this paper, we introduce a novel 3D-aware image generation method that leverages 2D diffusion models. We formulate the 3D-aware image generation task as multiview 2D image set generation, and further to a sequential unconditional-conditional multiview image generation process. This allows us to utilize 2D diffusion models to boost the generative modeling power of the method. Additionally, we incorporate depth information from monocular depth estimators to construct the training data for the conditional diffusion model using only still images. We train our method on a large-scale dataset, i.e., ImageNet, which is not addressed by previous methods. It produces high-quality images that significantly outperform prior methods. Furthermore, our approach showcases its capability to generate instances with large view angles, even though the training images are diverse and unaligned, gathered from "in-the-wild" real-world environments.

研究の動機と目的

  • 2D拡散モデルの強力な性能を活かして、3Dに注意を向けた画像生成を可能にすること。これらは3D生成タスクに効果的に応用されてこなかった。
  • 3Dの監視情報を必要とせず、構造のとれていない現実世界の2Dデータセットから一貫性のある複数視点画像を生成する課題に対処すること。
  • 複数視点の学習データの不足を補うために、単眼深度推定を活用して静止画像から複数視点の監視信号を合成すること。
  • ドメインギャップを低減するためのデータ拡張戦略を用いて、大視角(最大360°)での生成品質を向上させること。
  • ImageNetのような大規模かつ多様なデータセットにおいて、3Dに注意を向けた生成の可能性と有効性を示すこと。これまでは、このようなデータセットに対して未解決であった。

提案手法

  • 本手法は、3Dに注意を向けた画像生成を段階的な複数視点画像生成プロセスとして定式化する。まず無条件で初期視点をサンプリングし、その後に以前に生成された視点に条件づけて順次次の視点を生成する。
  • 複数視点の同時分布を因数分解するために確率の連鎖律を用い、可変長出力と効率的な自己回帰的生成を可能にする。
  • 単眼深度推定を単一画像に適用し、深度マップを生成。その後、それらを用いて学習用に複数視点の投影を合成する。
  • 各次の視点を、以前に生成された視点とそれに対応する深度マップに基づいて生成する条件付き拡散モデルを学習させることで、視点間で一貫性のある3Dジオメトリを実現する。
  • ドメインギャップを低減し一般化性能を向上させるために、特にぼかしとテクスチャの浸食拡張を導入する。特に大視角での生成において顕著な効果を示す。
  • 高解像度生成のため、事前学習済みの128²モデルから微調整された拡散ベースのスーパーレゾリューションモデルを用い、128²の出力を256²解像度にアップスケーリングする。

実験結果

リサーチクエスチョン

  • RQ13Dの明示的監視情報やNeRFベースの表現を必要とせずに、2D拡散モデルを3Dに注意を向けた画像生成に効果的に適応できるか?
  • RQ2拡散モデルを用いて、複数視点画像生成を段階的条件付き生成プロセスとしてどのようにモデル化できるか?
  • RQ3単眼深度推定を用いて、アライメントのとれていない現実世界の2D画像から十分な複数視点学習データを合成し、3Dに注意を向けた生成を可能にできるか?
  • RQ4ドメインギャップを低減し、大視角での生成性能を向上させるために、どのデータ拡張戦略が最も効果的か?
  • RQ5本手法は、従来の3Dに注意を向けたGANベースの手法が対象としていなかった大規模かつ多様なデータセット(例:ImageNet)で最先端の結果を達成できるか?

主な発見

  • 本手法は、ImageNetにおいて9.45のFréchet Inception Distance (FID) を達成し、EG3D (FID 40.4) やpi-GAN (FID 138) といった先行SOTAの3Dに注意を向けたGANと比べて顕著に優れた性能を示した。
  • SDIP Dogデータセットでは、9視点(17°ヨー範囲)でFIDが18.1を達成。浸食(erosion)なし(20.9)やぼかし(blur)なし(22.2)のアブレーションバリアントよりも優れた性能を示した。
  • 本手法は、アライメントのとれていない学習データからも、一貫性のある360°視点のシーケンスを生成でき、多様で構造のとれていない入力に対しても強靭であることを示した。
  • 統合型の視点合成手法は16 fpsの推論速度を達成し、ImageNetではFIDが14.1を維持しており、任意視点生成の実用的応用可能性を示している。
  • 高解像度生成パイプラインは、微調整された拡散スーパーレゾリューションモデルを用いて128²出力を256²にアップスケーリングし、画像品質と3Dの一貫性を保持した。
  • アブレーションスタディにより、テクスチャの浸食とぼかし拡張が、アーチファクトの低減と大視角合成における性能向上に不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。