Skip to main content
QUICK REVIEW

[論文レビュー] Pushing the Limits of 3D Shape Generation at Scale

Yu Wang, Xuelin Qian|arXiv (Cornell University)|Jun 20, 2023
3D Shape Modeling and Analysis被引用数 4
ひとこと要約

本稿では、3.6Bパラメータの自己回帰的3D形状生成モデルArgus-3Dを紹介する。このモデルは、三平面潜在表現、量子化のための離散コードブック、トランスフォーマーに基づく条件付き生成を活用し、品質と多様性の面で最先端の性能を達成している。ModelNet40、ShapeNet、Pix3D、3D-Future、Objaverseなど複数の3Dリポジトリをカバーする90万オブジェクトのデータセットで学習されたことで、テキスト、画像、クラスラベルによる3D生成の分野で新たなベンチマークを設定し、FPD(0.774)およびTMD(5.136 × 10²)の優れたスコアを達成した。

ABSTRACT

We present a significant breakthrough in 3D shape generation by scaling it to unprecedented dimensions. Through the adaptation of the Auto-Regressive model and the utilization of large language models, we have developed a remarkable model with an astounding 3.6 billion trainable parameters, establishing it as the largest 3D shape generation model to date, named Argus-3D. Our approach addresses the limitations of existing methods by enhancing the quality and diversity of generated 3D shapes. To tackle the challenges of high-resolution 3D shape generation, our model incorporates tri-plane features as latent representations, effectively reducing computational complexity. Additionally, we introduce a discrete codebook for efficient quantization of these representations. Leveraging the power of transformers, we enable multi-modal conditional generation, facilitating the production of diverse and visually impressive 3D shapes. To train our expansive model, we leverage an ensemble of publicly-available 3D datasets, consisting of a comprehensive collection of approximately 900,000 objects from renowned repositories such as ModelNet40, ShapeNet, Pix3D, 3D-Future, and Objaverse. This diverse dataset empowers our model to learn from a wide range of object variations, bolstering its ability to generate high-quality and diverse 3D shapes. Extensive experimentation demonstrate the remarkable efficacy of our approach in significantly improving the visual quality of generated 3D shapes. By pushing the boundaries of 3D generation, introducing novel methods for latent representation learning, and harnessing the power of transformers for multi-modal conditional generation, our contributions pave the way for substantial advancements in the field. Our work unlocks new possibilities for applications in gaming, virtual reality, product design, and other domains that demand high-quality and diverse 3D objects.

研究の動機と目的

  • 既存の3D形状生成モデルが高品質で多様性に富んだ、高解像度の形状を生成する点で抱える限界を是正すること。
  • 自己回帰的3D生成を、前例のない規模のモデルサイズとデータスケールにまで拡大し、より豊富で複雑な形状合成を可能にすること。
  • CLIPベースのテキストおよび画像特徴量を統合することで、統一された3D生成フレームワークに多モーダル条件付き生成を向上させること。
  • 効率的な三平面潜在表現と離散コードブックによる量子化を用いることで、3D生成における計算複雑性を低減すること。
  • 広範な多様性を持つ公開3Dデータセットのエントリを統合して学習することで、3D形状生成分野における新たなベンチマークを確立すること。

提案手法

  • 3D形状生成に適応した自己回帰的モデルアーキテクチャを採用し、36億パラメータにまでスケーリングすることで、これまでで最大の同種モデルを実現した。
  • 計算複雑性を低減しつつも空間的構造を保持するため、三平面特徴量を3D潜在表現として採用した。
  • 三平面特徴量の量子化を可能にするための離散コードブックを導入し、トランスフォーマーによる効率的なシーケンスモデリングを実現した。
  • CLIP埋め込み特徴量を用いて、テキスト、画像、またはクラスラベルを条件として、トランスフォーマーに基づくデコーダーが量子化済み潜在シーケンスを予測した。
  • ModelNet40、ShapeNet、Pix3D、3D-Future、Objaverseからなる、90万個の3Dオブジェクトから構成される洗練されたデータセットを用いて学習し、広範な一般化能力を実現した。
  • CLIPを活用した多モーダル条件付き生成により、高精細なゼロショットテキストから3Dへの生成および画像から3Dへの生成を実現した。

実験結果

リサーチクエスチョン

  • RQ1自己回帰的3D生成を36億パラメータにまでスケーリングすることで、形状の品質と多様性が顕著に向上するか?
  • RQ2三平面潜在表現と離散コードブックによる量子化を組み合わせることで、計算コストを低減しつつ3D構造を保持できるか?
  • RQ31つの統一モデルが、複数のモダリティ(テキスト、画像、クラスラベル)に対して高精細な3D形状を生成できるか、その程度はいかほどか?
  • RQ490万オブジェクトの多様なデータセットで学習させることで、モデルは記憶に依存するのではなく、3D形状の背後にある分布を学習できるか?
  • RQ5高解像度と多様性を維持しながら、画像誘導型3D生成分野で最先端の性能を達成できるか?

主な発見

  • Argus-3Dモデルは、画像誘導型生成において、Fréchet Point Cloud Distance(FPD)が0.774に達し、先行する最先端手法を顕著に上回った。
  • 画像誘導型生成において、Total Mutual Difference(TMD)スコアが5.136 × 10²に達し、既存のモデルと比較して優れた多様性を示した。
  • テキスト誘導型ゼロショット生成では、細部まで洗練され、意味的に整合性のある3D形状を生成し、視覚的品質と多様性の面で、従来のゼロショットアプローチを上回った。
  • Pix3Dの実際の画像からも、モデルは生成された3D形状において重要なオブジェクトの特徴を正確に再構築する強力な一般化能力を示した。
  • Chamfer Distanceの最近傍探索による検証により、モデルは学習データの記憶に依存するのではなく、新規の形状を生成していることが確認された。
  • 画像誘導型、テキスト誘導型、クラス誘導型の3D生成ベンチマークにおいて、評価されたすべての指標で最先端の性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。