[論文レビュー] CLAY: A Controllable Large-scale Generative Model for Creating High-quality 3D Assets
CLAY は 15億パラメータの 3Dネイティブな生成モデルであり、マルチリゾリューション VAE と潜在 Diffusion Transformer を用いて、テキスト、画像、3Dプリミティブを用いて高精細で制御可能な 3D モデルの作成を可能にする。テキストから 3D への生成および画像から 3D への生成タスクにおけるユーザースタディーにおいて、幾何学的形状の品質で前例を上回る 78.9%、外観の品質で 85.4% の優位性を示した。
In the realm of digital creativity, our potential to craft intricate 3D worlds from imagination is often hampered by the limitations of existing digital tools, which demand extensive expertise and efforts. To narrow this disparity, we introduce CLAY, a 3D geometry and material generator designed to effortlessly transform human imagination into intricate 3D digital structures. CLAY supports classic text or image inputs as well as 3D-aware controls from diverse primitives (multi-view images, voxels, bounding boxes, point clouds, implicit representations, etc). At its core is a large-scale generative model composed of a multi-resolution Variational Autoencoder (VAE) and a minimalistic latent Diffusion Transformer (DiT), to extract rich 3D priors directly from a diverse range of 3D geometries. Specifically, it adopts neural fields to represent continuous and complete surfaces and uses a geometry generative module with pure transformer blocks in latent space. We present a progressive training scheme to train CLAY on an ultra large 3D model dataset obtained through a carefully designed processing pipeline, resulting in a 3D native geometry generator with 1.5 billion parameters. For appearance generation, CLAY sets out to produce physically-based rendering (PBR) textures by employing a multi-view material diffusion model that can generate 2K resolution textures with diffuse, roughness, and metallic modalities. We demonstrate using CLAY for a range of controllable 3D asset creations, from sketchy conceptual designs to production ready assets with intricate details. Even first time users can easily use CLAY to bring their vivid 3D imaginations to life, unleashing unlimited creativity.
研究の動機と目的
- 人間の想像とデジタル 3D モデリングの間のギャップを埋め、高精細な 3D モデル作成を容易にすること。
- 従来の 3D 生成ツールが要求する高度な専門知識や人的労力の制限を克服すること。
- テキスト、画像、3D プリミティブなど多様なモダリティを高幾何学的・素材的忠実度で処理できるスケーラブルな 3D ネイティブな生成モデルを開発すること。
- スケーラブルな 3D 生成モデリングを支援する大規模かつ高品質な 3D データセットおよびトレーニングパイプラインを構築すること。
- 初心者から専門家まで、最小限の努力で複雑でプロダクション用に適した 3D モデルを生成できるようにすること。
提案手法
- CLAY は、多様な 3D ジオメトリから階層的な 3D プライオリティを抽出するためのマルチリゾリューション変分オートエンコーダー(VAE)を採用し、効率的な潜在空間表現を実現する。
- 潜在空間に最小限の潜在 Diffusion Transformer(DiT)を用いて、高幾何学的忠実度の連続的かつ完全な 3D 表面を生成する。
- 標準化された処理パイプラインを経て収集された大規模な 3D データセットを用い、効率的なスケーリングを実現するプログレッシブトレーニングスキームを適用する。
- 外観生成のため、マルチビュー素材 Diffusion モデルを用いて、2K 解像度の PBR テクスチャ(ディフューズ、ラフネス、メタリックモダリティを含む)を高忠実度で生成する。
- テキスト、画像、マルチビュー画像、ボクセル、ボクシングボックス、点群、および暗黙的表現を含む、マルチモーダルな制御入力をサポートする。
- GPT-4V を活用した自動アノテーションシステムにより、トレーニングデータパイプラインのデータ効率と一貫性が向上する。
実験結果
リサーチクエスチョン
- RQ1大規模で 3D ネイティブな生成モデルは、多様な入力モダリティにおいて高精細な幾何学的形状と素材の生成を達成できるか?
- RQ2マルチリゾリューション VAE を用いた潜在 Diffusion Transformer は、2D ベースの手法や直接的な 3D 最適化手法と比較して、どのように 3D 生成品質を向上させるか?
- RQ3CLAY は、テキスト入力のみで 'トラがオートバイを乗っている' といった複雑で構成された 3D オブジェクトをどれほど一般化して生成できるか?
- RQ4CLAY の性能は、テキストから 3D への生成および画像から 3D への生成タスクにおいて、幾何学的形状と外観の両面で最先端モデルと比較してどうなるか?
- RQ5大規模で選別された 3D データセットおよびプログレッシブトレーニングスキームは、モデルのスケーラビリティと生成品質にどのような影響を与えるか?
主な発見
- テキストから 3D への生成タスクにおいて、CLAY は幾何学的形状の品質で 78.9% のユーザーランクを達成し、最良の代替手法である RichDreamer よりも顕著に優れていた。RichDreamer は約 2 時間の最適化を要したが、CLAY は約 45 秒で完了した。
- 画像から 3D への生成タスクにおいて、CLAY は幾何学的形状の品質で 91.2%、外観の品質で 85.4% のユーザーランクを獲得し、優れた性能と高速性を示した。
- CLAY は、ディフューズ、ラフネス、メタリックチャネルを含む 2K 解像度の PBR テクスチャを高忠実度で生成し、現実的な物理ベースレンダリングを可能にした。
- モデルは、テキスト、画像、複数の 3D プリミティブ形式を含む多様な 3D コントロールに対して強い一般化能力を示し、柔軟で直感的なデザインワークフローを実現した。
- GPT-4V を用いた自動アノテーションと標準化されたリメッシュ処理を統合した CLAY のトレーニングパイプラインにより、大規模な 3D データセット全体にわたるデータの一貫性とスケーラビリティが確保された。
- 単一オブジェクトでは優れた性能を示したが、'トラがオートバイを乗っている' といった複雑な構成シーンの生成においては、テキスト入力の記述の詳細不足およびトレーニングデータの不足により限界が見られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。