Skip to main content
QUICK REVIEW

[論文レビュー] Sin3DM: Learning a Diffusion Model from a Single 3D Textured Shape

Rundi Wu, Ruoshi Liu|arXiv (Cornell University)|May 24, 2023
3D Shape Modeling and Analysis被引用数 6
ひとこと要約

Sin3DMは、1つの3Dテクスチャード形状上でトレーニングされた最初の拡散モデルを紹介する。幾何学的形状とテクスチャを低次元の潜在空間に圧縮するためにトライプレーン特徴マップを活用する。トライプレーンに特化した畳み込みを備えた小規模な受容 field を持つU-Netノイズ除去器をこれらのトライプレーン上でトレーニングすることで、細部にまでこだわった高品質で多様な3Dバリエーションを生成可能であり、再トレーニングなしにアウトペイントやパッチ複製といった制御可能な編集も可能となる。

ABSTRACT

Synthesizing novel 3D models that resemble the input example has long been pursued by graphics artists and machine learning researchers. In this paper, we present Sin3DM, a diffusion model that learns the internal patch distribution from a single 3D textured shape and generates high-quality variations with fine geometry and texture details. Training a diffusion model directly in 3D would induce large memory and computational cost. Therefore, we first compress the input into a lower-dimensional latent space and then train a diffusion model on it. Specifically, we encode the input 3D textured shape into triplane feature maps that represent the signed distance and texture fields of the input. The denoising network of our diffusion model has a limited receptive field to avoid overfitting, and uses triplane-aware 2D convolution blocks to improve the result quality. Aside from randomly generating new samples, our model also facilitates applications such as retargeting, outpainting and local editing. Through extensive qualitative and quantitative evaluation, we show that our method outperforms prior methods in generation quality of 3D shapes.

研究の動機と目的

  • 1つの例しか利用できない状況で、多様で高品質な3Dテクスチャード形状を生成する課題に取り組む。
  • 3Dグリッド上で直接拡散モデルをトレーニングする場合の高いメモリと計算コストを克服する。
  • 再トレーニングなしに、アウトペイント、リターゲティング、ローカル編集といった制御可能な生成タスクを可能にする。
  • 1つの形状からローカルなパッチレベルの特徴を学習し、生成されたバリエーションにおける構造的・テクスチャ的整合性を維持する。
  • PBRマテリアルをサポートするようにフレームワークを拡張し、現代のグラフィックスパイプラインでリアルなレンダリングを可能にする。

提案手法

  • 学習されたオートエンコーダーを用いて、符号付き距離関数およびテクスチャ関数を表すトライプレーン特徴マップに1つの3Dテクスチャード形状を圧縮する。
  • 受容 field を限定的(特徴マップサイズの約40%)にした2次元U-Netベースの拡散モデルを、トライプレーン潜在空間上でトレーニングし、過学習を回避する。
  • 3つの軸に沿った特徴マップ間のクロスプレーン関係をモデル化する、トライプレーンに特化した2次元畳み込みブロックを統合する。
  • 固定されたクリーン入力を持つ1つの例でのトレーニングを安定化させるために、拡散プロセスでノイズ予測(ε予測)を用いる。
  • 推論時制御を可能にするために、空間マスクを活用:ノイズ除去中にマスクされた領域を指定されたコンテンツ(例:パディングされた入力やコピーされたパッチ)に置き換える。
  • 専用のMLPヘッドを追加することで、デコーダーを拡張し、PBRマテリアル(ベースカラー、金属性、粗さ、法線)を予測可能にする。

実験結果

リサーチクエスチョン

  • RQ1大規模なデータセットがなくても、1つの3Dテクスチャード形状上で効果的に拡散モデルをトレーニングできるか?
  • RQ23D拡散モデルをトレーニングする際のメモリと計算コストをどのように低減できるか?
  • RQ3受容 field のサイズやトライプレーンに特化した畳み込みといったアーキテクチャ的選択が、1つの例からの生成品質と一般化性能をどのように向上させるか?
  • RQ4再トレーニングなしに、アウトペイントやローカル編集といった制御可能な生成タスクをサポートできるか?
  • RQ5PBRマテリアルへの一般化はどの程度うまくいくか?また、リアルでレンダラブルな3Dアセットを生成できるか?

主な発見

  • Sin3DMは、幾何学的・テクスチャ的整合性に優れた多様な3D形状を生成し、定量的・定性的な両評価で先行研究の単一形状手法を上回る性能を示した。
  • ベースライン手法、特にトライプレーンに特化した畳み込みを含まないバージョンや異なるトレーニング目的を持つバージョンと比較して、FIDおよびLPIPSスコアが優れていた。
  • マスクによる制御生成により、効果的なアウトペイントとパッチ複製が実現され、滑らかな遷移と一貫性のある構造の維持が達成された。
  • PBRマテリアルのサポートにより、Blender や Unreal Engine と互換性のある物理ベースレンダリング可能なアセットの生成が可能になった。
  • アブレーションスタディの結果、トライプレーンに特化した畳み込みとε予測が生成品質を顕著に向上させると確認された。一方、エンコーダーを削除するか損失関数を変更すると、性能が著しく低下した。
  • 成功を収めたものの、トライプレーン表現の特性上、生成されたバリエーションが3つの主軸方向に偏る傾向があることが判明した。今後の研究では、より表現力に優れた3D潜在表現の導入が求められる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。