Skip to main content
QUICK REVIEW

[論文レビュー] ISS: Image as Stepping Stone for Text-Guided 3D Shape Generation

Zhengzhe Liu, Peng Dai|arXiv (Cornell University)|Sep 9, 2022
3D Shape Modeling and Analysis被引用数 4
ひとこと要約

本稿では、ペairedなテキスト-形状データセットを必要とせず、テキストと3D形状の間の意味的ギャップを埋めるために2D画像を中間ステップとして用いる、新しいテキストガイドド3D形状生成フレームワークISSを提案する。CLIPの共同テキスト-画像埋め込みと事前学習済みの単一視点再構成モデルを活用し、2段階の特徴空間アライメントを実行することで、85秒未塔で高精細で一貫性のある3D形状を生成する。従来手法に比べ、忠実度、一貫性、スタイル化能力において優れている。

ABSTRACT

Text-guided 3D shape generation remains challenging due to the absence of large paired text-shape data, the substantial semantic gap between these two modalities, and the structural complexity of 3D shapes. This paper presents a new framework called Image as Stepping Stone (ISS) for the task by introducing 2D image as a stepping stone to connect the two modalities and to eliminate the need for paired text-shape data. Our key contribution is a two-stage feature-space-alignment approach that maps CLIP features to shapes by harnessing a pre-trained single-view reconstruction (SVR) model with multi-view supervisions: first map the CLIP image feature to the detail-rich shape space in the SVR model, then map the CLIP text feature to the shape space and optimize the mapping by encouraging CLIP consistency between the input text and the rendered images. Further, we formulate a text-guided shape stylization module to dress up the output shapes with novel textures. Beyond existing works on 3D shape generation from text, our new approach is general for creating shapes in a broad range of categories, without requiring paired text-shape data. Experimental results manifest that our approach outperforms the state-of-the-arts and our baselines in terms of fidelity and consistency with text. Further, our approach can stylize the generated shapes with both realistic and fantasy structures and textures.

研究の動機と目的

  • 大規模なペアドテキスト-形状データセットに依存せずに、テキストガイドド3D形状生成の課題に対処すること。
  • 従来の手法が忠実度と一貫性に悪影響を及げる、テキストと3D形状の間の顕著な意味的ギャップを埋めること。
  • 実際の構造やファンタジー風の構造・テクスチャを含む広範なカテゴリにわたる多様な3D形状の生成を可能にすること。
  • Dream Fieldsのような最適化ベースの手法に比べ、推論時間を大幅に短縮すること。
  • 入力テキストと生成された形状のビューの間の強いCLIP一貫性を実現し、意味的アライメントを向上させること。

提案手法

  • 2段階の特徴空間アライメントフレームワークを導入:まず、マルチビューの監視を伴う事前学習済みの単一視点再構成(SVR)モデルを介して、CLIP画像特徴を詳細豊かな3D形状空間にマッピングする。
  • 次に、入力テキストと生成形状のレンダリング画像間のCLIP一貫性損失を用いてマッパーを微調整し、テキスト-形状アライメントを向上させる。
  • CLIPの共同埋め込み空間を活用して、CLIP画像特徴とテキスト特徴を同じ形状特徴空間にマップするCLIP2Shapeマッパーを採用する。
  • 事前学習済みのSVRモデルを活用して、生成プロセスに強い3D形状の事前知識を組み込み、高精細な再構成を可能にする。
  • テキストガイドド形状スタイル化モジュールを適用し、学習分布外の新しい構造やテクスチャを生成する。
  • 占有度、色、背景、CLIP一貫性損失の組み合わせを最適化することで、マルチビューの一貫性と意味的アライメントを確保する。

実験結果

リサーチクエスチョン

  • RQ12D画像は、ゼロショット3D生成におけるテキストと3D形状の意味的ギャップを埋める有効な中間ステップとして機能するか?
  • RQ22段階の特徴空間アライメント戦略は、ペアドテキスト-形状データが存在しない状況でもテキストから3D形状への一貫性を向上させられるか?
  • RQ3提案手法は、微調整なしで、実際的およびファンタジー風のデザインを含む多様なカテゴリにわたる高精細3D形状を生成できるか?
  • RQ4Dream Fieldsのような最適化ベースのベースラインと比較して、提案手法の推論速度はどの程度か?
  • RQ5CLIP一貫性損失は、入力テキストと生成された3D形状ビューの間のアライメントをどの程度向上させるか?

主な発見

  • 提案されたISSフレームワークは、1インスタンスあたり85秒未塔で3D形状を生成でき、1形状あたり72分以上を要するDream Fieldsに比べて顕著に高速である。
  • ShapeNetおよびCO3Dベンチマークにおいて、最先端の手法に比べ、ISSは優れたFIDスコアを達成しており、生成忠実度の高さが示された。
  • 人間の知覚評価により、CLIP-Forge や Dream Fields といったベースラインと比較して、ISSが生成する形状はテキスト記述とより一貫していることが確認された。
  • 本手法は、実際的およびファンタジー風の3D形状を、整合性のある構造とテクスチャを伴って効果的に生成でき、カテゴリにわたる広範な適用性を示した。
  • アブレーションスタディの結果、2段階のアライメントとCLIP一貫性損失が、テキスト-形状アライメントの向上と意味的ギャップの低減に不可欠であることが示された。
  • フレームワークはShapeNetのカテゴリをはるかに超えて一般化できており、学習データに存在しないレアまたは未確認のオブジェクトタイプに対しても、妥当な形状を生成できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。