Skip to main content
QUICK REVIEW

[論文レビュー] Score Jacobian Chaining: Lifting Pretrained 2D Diffusion Models for 3D Generation

Haochen Wang, Xiaodan Du|arXiv (Cornell University)|Dec 1, 2022
Generative Adversarial Networks and Image Synthesis被引用数 5
ひとこと要約

本稿では、事前学習された2D拡散モデルのスコアを微分可能ボクセルレイトランスレーターレンダラーを通じて逆伝播することで、3Dレイトランスフィールドを生成するScore Jacobian Chaining (SJC)という手法を提案する。非ノイズ画像にノイズ除去器を適用する際の分布シフト問題を解消するためのPerturb-and-Average Scoringを導入し、3Dデータや微調整を一切用いずに高品質なテキストから3Dへの生成を実現する。

ABSTRACT

A diffusion model learns to predict a vector field of gradients. We propose to apply chain rule on the learned gradients, and back-propagate the score of a diffusion model through the Jacobian of a differentiable renderer, which we instantiate to be a voxel radiance field. This setup aggregates 2D scores at multiple camera viewpoints into a 3D score, and repurposes a pretrained 2D model for 3D data generation. We identify a technical challenge of distribution mismatch that arises in this application, and propose a novel estimation mechanism to resolve it. We run our algorithm on several off-the-shelf diffusion image generative models, including the recently released Stable Diffusion trained on the large-scale LAION dataset.

研究の動機と目的

  • 3Dデータや再訓練にアクセスせずに、事前学習済み2D拡散モデルのみを用いて3D生成を可能にすること。
  • 最適化中にノイズのないレンダリングされた3D画像に、ノイズ画像で学習されたノイズ除去器を適用する際の分布外(OOD)問題に対処すること。
  • 複数の視点からの2D画像勾配を統合して3Dスコアを生成し、3Dアセット最適化に用いる手法を開発すること。
  • 適応的スケジューリングを用いた新規な空洞正則化損失により、3D生成品質を向上させること。
  • 拡散モデルを用いた3D最適化の文脈において、ノイズスケジューリングとクラス条件付きガイドラインの影響を調査すること。

提案手法

  • 2D拡散モデルを学習済みスコア関数(対数密度の勾配)として解釈し、微分可能レンダラーのヤコビアンを通じて合成則を適用する。
  • ボクセルベースのレイトランスフィールドを3Dパラメータ化θとして用い、体積レンダリングを微分可能関数f(θ)として定義し、3Dパラメータから2D画像xπを生成する。
  • 非ノイズ画像のスコアを推定するために、複数の摂動版を平均化するPerturb-and-Average Scoring (PAAS)を提案し、OOD問題を緩和する。
  • 合成則を適用:∇θ log pσ(θ) = Jπ^T · ∇x log pσ(xπ) ここでJπはレンダラーのヤコビアン、∇xは拡散モデルからのスコアである。
  • 3Dボリューム内の空洞またはスパースな領域をペナルティとする空洞損失を導入し、幾何学的品質の向上とアーチファクト低減を図るための動的重みスケジューリングを採用する。
  • チェーンされたスコアをガイド信号として用い、潜在空間での拡散推論を活用することで、3Dレイトランスフィールドを最適化する。

実験結果

リサーチクエスチョン

  • RQ1事前学習済み2D拡散モデルを、3Dデータや微調整なしに効果的に3D生成に再利用できるか?
  • RQ2最適化中にノイズのないレンダリングされた3D画像に、ノイズ画像で学習されたノイズ除去器を適用する際の分布シフト問題は、どのように解決できるか?
  • RQ3テキスト条件付き設定下で、3D生成品質を向上させるために、どのノイズスケジューリング戦略(例:徐々に減少するσ vs. ランダムσ)が効果的か?
  • RQ4言語ガイドラインのスケーリングは、最適化ベースの3D生成パイプラインの性能にどのように影響するか?
  • RQ5特に空洞損失のような正則化は、3D幾何学の向上とアーチファクト低減にどのような役割を果たすか?

主な発見

  • Perturb-and-Average Scoringは、ノイズ画像で学習されたノイズ除去器を非ノイズのレンダリング画像に適用する際の分布外問題を効果的に緩和し、安定した3Dアセット最適化を可能にする。
  • 高水準の言語ガイドライン(スケール10.0)を用いたランダムσスケジューリングが、アニールドσスケジューリングを上回り、よりシャープで整合性の高い3Dモデルを生成する。
  • 適応的スケジューリングを用いた提案された空洞損失は、定数または無しの損失と比較して、浮遊アーチファクトを低減し、よりクリアな深度マップを生成する点で3D幾何学の質を顕著に向上させる。
  • SJCは、シドニー・オペラ・ハウスのような複雑な物体や詳細な家具など、多様なテキストプロンプトに対して高品質な3Dアセットを生成でき、優れた一般化性能を示す。
  • 定性的な比較では、同じベースモデルを用いた同時期の手法Stable-DreamFusionと比較して、SJCは画像品質が高く、構造的にもより整合性のある3Dモデルを生成する。
  • 強力な性能を示す一方で、試行ごとの品質のばらつきが依然として見られ、PAASを勾配信号として最適に適用する方法は未解決の問題のままである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。