[論文レビュー] 3DGen: Triplane Latent Diffusion for Textured Mesh Generation
3DGen は、三平面 VAE と拡散モデルを用いた二段階パイプラインを導入し、カテゴリを跨いだ高品質なテクスチャ付きメッシュを生成可能にする。画像条件、テキスト条件、無条件生成を強力なスケーラビリティで実現。
Latent diffusion models for image generation have crossed a quality threshold which enabled them to achieve mass adoption. Recently, a series of works have made advancements towards replicating this success in the 3D domain, introducing techniques such as point cloud VAE, triplane representation, neural implicit surfaces and differentiable rendering based training. We take another step along this direction, combining these developments in a two-step pipeline consisting of 1) a triplane VAE which can learn latent representations of textured meshes and 2) a conditional diffusion model which generates the triplane features. For the first time this architecture allows conditional and unconditional generation of high quality textured or untextured 3D meshes across multiple diverse categories in a few seconds on a single GPU. It outperforms previous work substantially on image-conditioned and unconditional generation on mesh quality as well as texture generation. Furthermore, we demonstrate the scalability of our model to large datasets for increased quality and diversity. We will release our code and trained models.
研究の動機と目的
- 単一カテゴリモデルを超える、スケーラブルで高品質な3Dテクスチャ付きメッシュ生成の実現を目指す。
- ドウェ-stage アーキテクチャを開発し、テクスチャ付きメッシュの compact な三平面潜在表現を学習し、拡散を通じて生成する。
- 画像で条件付けられたものやテクスチャなしのメッシュ生成を可能にし、画像やテキストで条件付け可能、効率的なGPU対応推論。
提案手法
- 色付き点群を3D対応の三平面潜在特徴に符号化し、 differentiable marching tetrahedra によってテクスチャ付きメッシュへデコードする三平面 VAE を訓練する。
- 展開された三平面上で動作する拡散モデルを訓練し、画像-テキスト埋め込みに条件付けられた、または無条件に三平面特徴を生成する。
- differentiable レンダラーと DMTet を用いた訓練のためのレンダリングベースの損失、KL、平滑化、再構成項を用いる。
- cross-attention を用いず、凍結された image-text ビ-エンコーダと AdaGN ベースの条件付けで拡散を image 埋め込みに条件付けし、スケーラブルなテキスト条件生成を可能にする。
- 後段で高解像度の四面体格子を用いて拡散を微調整し、細部と陰影を改善する。
実験結果
リサーチクエスチョン
- RQ1三平面 VAE と拡散モデルを組み合わせた二段階フレームワークは、多様なカテゴリにわたる高品質で条件付きおよび無条件のテクスチャ付きメッシュを学習できるか?
- RQ2拡散を画像埋め込みまたはテキスト埋め込みで条件付けることは、無条件生成と比べて幾何学とテクスチャの忠実性を改善するか?
- RQ3データ規模の拡大(Objaverse に似た大規模データセットでの事前訓練など)は、幾何精度とテクスチャ品質にどのような影響を及ぼすか?
- RQ4どのようなアーキテクチャの選択(条件付け手法、VAE 解像度、表面テクスチャモデリング)がメッシュ品質とテクスチャ忠実度に最も影響を与えるか?
主な発見
- 3DGen は、前作と比較して複数の設定で顕著な改善を示す。無条件のジオメトリ生成は NFD に対して FiD が 23% 向上、無条件のカラー付きメッシュ生成は最大で FiD が 70% 向上、テキスト条件付きジオメトリ生成は SoTA 3DILG に対して 15-20% の改善。
- 二段階の三平面アプローチは、カテゴリ横断の条件付きおよび無条件のテクスチャ付きまたは無テクスチャのメッシュ生成を、単一GPU上の数秒で可能にする。
- 大規模データセット(Objaverse + 3D Warehouse)で事前訓練すると Chamfer 距離と FiD スコアが改善され、低リソースカテゴリでより顕著な利得が見られる。
- テキスト埋め込みを用いたテキスト条件付き生成は、プロンプトと整合した適切なオブジェクト生成を示し、単純なプロンプトベースの条件付けで方法の柔軟性を示す。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。